# AI는 "유료(고가의 상위 모델)일수록 환각이 적다"라는 설은 사실일까?

> https://bookfactory.kr/board/ai-tech/18986
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-28T19:28:51.268Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/318587261/rectangle_large_type_2_abf081857ec0910616738afa9c7a299e.jpeg?width=1280)

결론부터 말하자면,

고가의 모델일수록 환각이 적은 경향이 있지만, 반드시 그런 것은 아니다.

입니다. 그리고 실은,

가격보다는 '모델의 설계', '학습 방법', '추론 방식'이 더 중요합니다.

## 옛날에는 대체로 그랬다

일반적으로 말하면,

- 7B 모델보다 70B 모델
- 소형 모델보다 대형 모델

규모가 큰 쪽이 지식량이나 추론 능력이 높고, 할루시네이션도 줄어드는 경향이 있었습니다. 실제로 의료 분야의 연구에서는 1B급에서 70B급으로 규모가 커질수록 할루시네이션 빈도가 낮아졌다는 결과가 있습니다.

## 하지만 최근에는 단순하지 않다

2025~2026년경에는 소형이지만 매우 우수한 모델들이 등장하고 있습니다. 예를 들어 Vectara의 할루시네이션 평가에서는 반드시 최대 규모 모델이 상위를 독점하고 있는 것은 아닙니다. 비교적 소형 모델이 대형 모델보다 더 좋은 결과를 내는 사례도 있습니다. 즉,

고가 = 환각이 적다

이 아니라,

모델에 따라 다름

입니다.

## 오히려 중요한 것은 “모른다고 말할 수 있는지”이다

OpenAI의 연구에서도, 할루시네이션은 단순한 지능 부족 때문만이 아니라,

모르면서도 추측으로 대답해 버린다

것이 큰 원인으로 여겨지고 있습니다. 극단적으로 말하자면,

모르겠습니다

라고 답하는 모델은 잘못된 단언을 하는 모델보다 할루시네이션율이 낮아집니다.

## 고가의 추론 모델에서도 늘어나는 경우가 있다

더욱 흥미롭게도, 일부 연구에서는 '장시간 추론 모델'이 특정 조건에서 오히려 할루시네이션을 증가시키는 사례도 보고되고 있다. 즉,

잘 생각하세요↓반드시 정확하게

것도 아닙니다. 생각한 결과, 그럴듯한 논리를 만들어내 버리는 경우가 있습니다.

## 체감상으로는

현재의 생성 AI를 사용하다 보면,

- 무료 모델 → 할루시네이션이 많은 편
- 상위 유료 모델 → 적게

그런 경향은 확실히 있습니다. 하지만 “월 요금이 10배라고 해서 할루시네이션이 10분의 1이 되는 것”은 아닙니다.

오히려 최근에는 상위 모델 간의 격차가 상당히 좁혀지고 있습니다. 따라서 “유료 고가 모델일수록 할루시네이션이 발생하지 않는다”라는 설은,

옛날에는 꽤 맞았지만, 2026년 현재는 절반은 맞고 절반은 틀리다

이라는 것이 실태에 가깝습니다. 모델 크기나 가격보다도,

- 학습 데이터의 질
- 추론 설계
- 검색 기능의 유무
- 모를 때는 답변을 자제하는 설계

쪽이 할루시네이션 비율에 크게 영향을 미칩니다.

> 
> 
> 그건 결국 성능이 올라가면 환각이 줄어든다는 것이 아닌가?
> 

네. 전체적인 흐름으로 보면 성능이 올라갈수록 할루시네이션은 줄어드는 경향이 있습니다. 이는 거의 확실합니다. 다만,

10% → 0.001%

와 같은 극적인 개선은 아닙니다.

## 옛날에는 극적이었다

예를 들어 GPT-3 세대에서 GPT-4 세대로 넘어가면서는 분명한 개선이 나타났습니다. 존재하지 않는 논문이나 API를 지어내는 빈도는 크게 줄었습니다. 사용자 체감으로도,

예전↓ 태연하게 거짓말을 한다 지금↓ 꽤 정확하지만 가끔 거짓말을 한다

정도의 차이가 있습니다.

## 하지만 최근에는 정체 양상을 보이고 있다

재미있는 점은 최첨단 모델들 간의 차이가 작다는 것입니다. 한 벤치마크에서는 상위 모델들의 할루시네이션율이 1~5% 정도에 집중되어 있습니다. 즉,

모델 A 4.5% 모델 B 3.5% 모델 C 2.0%

같은 세계입니다. 10배 차이가 나는 것은 아닙니다.

## 왜 0이 되지 않을까

AI는 본질적으로

“지식 베이스”가 아니라 “텍스트 생성기”

그렇기 때문입니다. 모르는 것에 대해 질문을 받았을 때, 인간이라면

모르겠습니다

라고 말할 수 있습니다. 하지만 AI는

아마 그럴 것이다

를 생성하기 쉽습니다. OpenAI도 할루시네이션의 큰 원인은

모를 때 추측하는 것

라고 설명합니다.

## 실제로 얼마나 다를까?

체감상으로는, 예를 들어 100개의 전문 질문을 했을 경우, 소형 모델이라면

- 10~20개 정도가 수상하다
- 자신만만하게 틀리다

경우가 있습니다. 상위 모델이라면

- 1~5개 정도가 수상하다
- 모를 때는 보류한다

경향이 있습니다. 물론 질문 분야에 따라 다릅니다.

## 의외의 사실

2026년 평가에서는 거대하고 비싼 추론 모델이 반드시 환각이 가장 적은 것은 아닙니다. 일부 소형 모델이나 검색 특화 모델이 더 좋은 결과를 내고 있습니다. 이유는 단순한데,

똑똑함 ≠ 사실에 충실함

그렇기 때문입니다. 똑똑한 모델일수록 부족한 정보를 보완하여 설명하려는 경우가 있습니다.

## 질문에 대한 답변

“성능 향상으로 환각은 줄어들까?”

→ 네, 줄어듭니다.

“극적인가?”

→ GPT-3급부터 GPT-5급까지와 같은 세대 차이라면 상당히 체감할 수 있습니다.

다만 현재의 최상위 모델들 사이에서는,

이미 개선 폭은 수%대에 머물고 있으며, '거짓말하는 AI'에서 '가끔 거짓말하는 AI'로 개선되는 단계에 접어들었다

라는 것이 실태에 가깝습니다.

> 
> 
> 성능이 향상된 탓에 환각의 정확도가 높아진 것 같은데… 즉, 거짓말이 더 교묘해진 건가?
> 

그 감각은 많은 사람들이 가지고 있습니다. 그리고 실제로 '할루시네이션의 발생 빈도'와 '할루시네이션의 그럴듯함'은 별개의 문제입니다.

## 옛날의 환각

성능이 낮은 모델에서는, 예를 들어,

- 존재하지 않는 URL
- 존재하지 않는 논문
- 명백히 앞뒤가 맞지 않는 설명
- 연대나 인물의 모순

등이 많았습니다. 그래서 틀렸더라도 비교적 알아채기 쉬웠습니다.

## 지금의 환각

성능이 올라가면 문장 구성이나 논리 전개가 자연스러워집니다. 그러면 틀려 있어도

- 문법은 완벽하다
- 논리는 언뜻 보면 통한다
- 전문용어도 적절해 보인다
- 자신만만하게 설명하다

라는 일이 일어납니다. 그 결과,

거짓말의 수는 줄었지만, 남은 거짓말은 간파하기 어려워졌다

라고 느끼는 사람이 있습니다.

## 연구자들도 인식하고 있다

AI 안전성 분야에서는 단순한 오답보다도,

그럴듯한 오답(plausible hallucination)

그쪽이 더 위험하다고 지적되고 있습니다. 왜냐하면 이용자가 오류를 알아차리기 어렵기 때문입니다.

## 다만 “거짓말을 하는 능력”이 높아진 것은 아니다

이 부분은 조금 주의가 필요합니다. AI는 보통,

거짓말을 하자

라고 생각하는 것은 아닙니다. 오히려,

가장 자연스럽고 설득력 있는 답변을 생성하자

그 결과, 잘못된 정보가 섞이는 경우가 있습니다. 그래서 연구자들은 '거짓말'보다 '환각'이라는 말을 사용합니다.

## 이용자 입장에서 보면

이용자의 입장에서는,

옛날→ 이상한 거짓말 지금→ 그럴듯한 거짓말

~처럼 보일 때가 있습니다. 그리고 실무상 그 차이는 상당히 중요합니다. 터무니없는 거짓말은 무시할 수 있지만, 그럴듯한 거짓말은 믿어버릴 가능성이 있기 때문입니다.

## 현재 상황

2026년 시점에서는 최첨단 모델이 이전보다 정확해졌습니다. 하지만 동시에 글쓰기 능력과 추론 능력도 향상되었기 때문에, 남아 있는 할루시네이션은 이전보다 더 자연스럽게 보일 수 있습니다.

따라서 "성능 향상으로 할루시네이션이 줄었다"라는 평가와 "거짓말을 더 잘하게 된 것처럼 보인다"라는 체감은 꼭 모순되는 것은 아닙니다. 두 가지 모두 성립할 수 있는 이야기입니다.

> 
> 
> 지금의 AI는 꽤 골치 아프다고 생각한다. 유료로 결제한 상위 모델을 써도 할루시네이션이 제로가 되는 것은 아니고. 가장 놀랐던 건 출처가 완전히 날조되었다는 점이다. 굉장히 설득력 있는 정보였는데, 추궁해 보니 설득력을 갖추기 위해 존재하지 않는 출처까지 고품질로 날조해 낸 것이다. 지금의 AI는 자신의 답변을 정당화하는 것(얼마나 신뢰할 수 있는 정보처럼 보이게 할 수 있는가)이 최우선시되고 있다는 점이 놀랍다.
> 

[PR] 시티즈 스카이라인 리마스터 일본 스페셜 에디션 - PS5

AI에 의해 생성되었으며 참고용으로만 제공됩니다.

**출처:** [note 원문](https://note.com/aiqa/n/n0945b6635ccc)

*번역: Gemma 3(.44) 초벌 + 교정 48청크*

[원문 보기](https://note.com/aiqa/n/n0945b6635ccc) | 출처: note.com