AI 환각 현상이란? 챗봇이 자신 있게 틀리는 3가지 이유
기준일 2026년 8월 27일 · 출처 OpenAI 연구 블로그·ACM TOIS 서베이 논문·법률신문·이데일리
회사에서 보고서 쓰다가 급하게 챗봇한테 통계 하나 물어본 적 있으실 거예요. 자신 있게 숫자까지 딱 짚어서 알려주길래 그대로 붙여 넣었는데, 나중에 찾아보니 그런 통계가 아예 없더라는 경험. 저만 그런 거 아니죠?
이걸 AI 환각 현상(hallucination)이라고 불러요. 이 글은 “어떻게 걸러내느냐”보다 “왜 이런 일이 생기느냐”에 집중합니다. 원리를 알면 어디서 조심해야 하는지가 보이거든요. 실제로 답을 걸러내는 방법이 급하시다면 구별법만 따로 정리한 글을 먼저 보셔도 좋아요.
챗봇이 자신 있게 틀리는 이유
AI 환각 현상은 언어모델이 사실이 아닌 내용을 사실처럼 자신 있게 만들어내는 것을 말해요. 여기서 중요한 건 “자신 있게”입니다.
사람은 모르면 말끝이 흐려지죠. “아마 그럴걸요?” 같은 신호가 나옵니다. 그런데 언어모델은 확실히 아는 답과 지어낸 답을 같은 어투로 씁니다. 문장이 매끄러운 정도로는 진위를 구분할 수 없다는 뜻이에요. 오히려 지어낸 답일수록 더 깔끔하게 정리돼 나오기도 합니다.
버그가 아니라는 점도 짚어둘게요. AI 환각 현상은 어느 회사가 코드를 잘못 짜서 생긴 문제가 아니라, 지금 언어모델이 학습하고 평가받는 방식에서 자연스럽게 따라 나오는 결과에 가깝습니다.
🧩 AI 환각 현상, 종류가 이렇게 나뉩니다
“틀렸다”고 뭉뚱그리면 대처법이 안 나와요. 학계에서는 크게 두 갈래로 나눕니다(Huang 외, ACM TOIS 서베이).
| 구분 | 무엇과 어긋나나 | 실제로 이런 모습 |
|---|---|---|
| 사실성 환각 factuality |
세상의 사실과 어긋남 | 존재하지 않는 판례번호·논문·통계를 만들어냄 / 제도 시행 연도를 틀리게 말함 |
| 충실성 환각 faithfulness |
내가 준 자료나 지시와 어긋남 | 계약서에 보증금 5,000만원이라 적혀 있는데 요약본에 5억으로 씀 / “번역만 해줘”라고 했는데 요약해서 돌려줌 |
두 가지는 대처법이 완전히 달라요. 사실성 환각은 바깥 출처로 확인해야 잡히고, 충실성 환각은 내가 준 원문과 대조하면 잡힙니다. 문서를 통째로 넣고 요약시켰을 때 나는 오류는 대부분 두 번째예요. 원문만 다시 보면 바로 걸리는데, 그걸 안 하니까 넘어가는 거죠.

🔎 자신 있게 틀리는 3가지 이유
① 다음 단어를 확률로 고르기 때문에
언어모델은 “이 문장이 참인가”를 판단하고 답하는 게 아니에요. 앞 내용을 보고 다음에 올 법한 단어를 확률로 고릅니다. 그래서 “그럴듯함”이 1순위고 “사실임”은 그 결과로 따라오는 것에 가까워요.
OpenAI 연구진은 여기서 한 걸음 더 나갑니다. 학습 데이터에 오류가 하나도 없어도 사전학습 방식 자체에서 오류가 생긴다는 거예요. 특히 규칙성이 없는 정보가 문제입니다. 어떤 사람의 생일처럼 학습 데이터에 딱 한 번만 등장하는 사실은 패턴으로 익힐 수가 없어요. 패턴이 없으니 모델은 결국 그럴듯한 값을 채워 넣습니다.
논문은 이걸 설명하려고 “만약 생일 정보의 20%가 데이터에 한 번씩만 나온다면 그만큼은 틀릴 수밖에 없다”는 가정 예시를 듭니다. 실제로 측정한 환각률이 아니라 원리를 보여주는 예시라는 점은 짚어둘게요.
② 평가 방식이 ‘찍기’에 점수를 주기 때문에
이게 개인적으로 가장 흥미로운 대목이에요. OpenAI는 환각이 남아 있는 이유를 훈련과 평가가 “모르겠습니다”보다 “찍기”를 보상하기 때문이라고 설명합니다. 주요 벤치마크 대부분이 정답 아니면 오답으로 채점하고, “모르겠다”에는 부분점수를 주지 않거든요. 그러면 모델 입장에서 기권은 절대 이득이 될 수 없습니다. 시험에서 찍기라도 하는 게 낫는 것과 똑같아요.
OpenAI가 공개한 비교가 이걸 잘 보여줍니다.
| 모델 | 답을 안 한 비율 | 정답률 | 오답률 |
|---|---|---|---|
| gpt-5-thinking-mini | 52% | 22% | 26% |
| OpenAI o4-mini | 1% | 24% | 75% |
o4-mini는 거의 다 답합니다. 그래서 정답률이 2%p 높아요. 그런데 오답률은 3배 가까이 높습니다. “모르면 안 답한다”를 포기한 대가가 이겁니다. 점수표만 보면 후자가 나아 보이는데, 실제로 쓰는 사람 입장에서는 헛소리를 세 배 더 듣게 되는 거죠.
③ 사람이 ‘맞장구쳐주는 답’을 더 좋아하기 때문에
모델은 사람 피드백으로 다듬어집니다. 그런데 Anthropic 연구에 따르면 사람의 선호 판단 자체가 아첨을 보상해요. 답이 사용자의 생각과 맞아떨어지면 더 선호될 가능성이 높고, 설득력 있게 쓰인 틀린 답이 맞는 답보다 선택되는 경우도 무시할 수 없는 비율로 나타났습니다.
그러니까 “잘 모르겠는데요”라고 솔직하게 말하는 모델보다, 확신에 찬 어투로 정리해주는 모델이 더 좋은 점수를 받아온 셈이에요. 우리가 그렇게 길들인 면이 있는 겁니다.
📊 숫자로 보는 AI 환각 — 한국에서 실제로 벌어진 일
남 얘기가 아니에요. 2025년부터 국내에서 실제 사고가 이어졌습니다.
- 경찰 불송치 결정문에 없는 판례 — 경기 용인동부경찰서가 아동복지법 위반 사건 불송치 결정문에 대법원·서울북부지법 판결을 인용했는데, 실제로 존재하지 않는 판례였어요. 2025년 10월 17일 국회 행정안전위원회 국정감사에서 공개됐습니다.
- 형사 재판 의견서의 판결 5건 — 한 지방법원 형사재판부가 변호사 의견서에 인용된 판결 5개를 전산망에서 조회했더니 전부 없는 판결이었습니다(2025년 9월 보도).
법원행정처는 2025년 11월부터 2026년 3월까지 TF를 돌려 대응안을 내놨습니다. 허위 자료를 인용해 불필요한 비용을 발생시킨 당사자에게 소송비용을 부담시키고, 검증 없이 AI 자료를 인용한 변호사는 대한변협에 징계를 의뢰할 수 있게 하는 내용이에요. 사법정보공개포털은 2026년 2월부터 허위 사건번호를 확인하는 기능을 제공하고 있고요.
전문가가 본업에서 쓴 문서에서도 이 정도로 걸러지지 않았다는 게 핵심입니다. “나는 안 속겠지”라고 생각할 문제가 아니에요.
법정에서 벌어진 사례는 종류도 많고 숫자도 계속 늘고 있어요. 실제 판례 인용 사고를 모아 정리한 글에 벤치마크 수치와 함께 따로 담아 뒀습니다.

⚠️ 완전히 없애는 건 원리상 어렵습니다
기대치를 정확히 잡는 게 중요해서 솔직하게 적을게요. AI 환각 현상은 다음 버전이 나오면 사라지는 종류의 문제가 아닙니다.
- 통계적으로 — 학습 데이터가 완벽해도 한 번만 등장한 사실은 학습할 수 없어요(OpenAI 논문).
- 구조적으로 — 평가 체계가 찍기를 보상하는 한 모델은 계속 찍습니다. 그래서 OpenAI가 제안한 해법도 새 벤치마크를 만드는 게 아니라 기존 리더보드의 채점 방식을 고치자는 쪽이에요.
- 이론적으로 — 싱가포르국립대 연구팀은 환각이 언어모델의 타고난 한계라 필연적이라고 주장합니다. 다만 이건 동료심사 게재가 확인되지 않은 프리프린트 논문의 주장이라, 정설로 받아들이기보다 하나의 논증으로 보시는 게 맞아요.
흥미로운 관찰도 있어요. Anthropic이 자사 모델(Claude 3.5 Haiku)의 내부를 들여다본 연구에 따르면, 모델에는 “모른다고 답하는 것”이 기본값인 회로가 있고, 아는 대상을 만나면 그 회로가 억제되면서 답을 한다고 합니다. 환각은 이 억제가 잘못 켜질 때 생겨요. 이름은 들어본 것 같은데 실제 지식은 없는 경우에도 “안다” 쪽 스위치가 켜져 버리는 거죠. 연구진이 그 스위치를 인위적으로 켜자, 모델은 실존하지 않는 인물이 체스를 둔다고 일관되게 지어냈습니다.
환각과 오답, 구별이 헷갈리시죠
Q. 유료 모델을 쓰면 AI 환각 현상이 없어지나요?
줄어들긴 해도 없어지진 않아요. 위에서 본 것처럼 원인이 모델 성능만의 문제가 아니거든요. 오히려 성능이 좋아질수록 문장이 더 그럴듯해져서 눈으로 걸러내기는 어려워집니다.
Q. 인터넷 검색을 붙이면 해결되지 않나요?
사실성 환각은 많이 줄어듭니다. 다만 이번엔 충실성 환각이 남아요. 찾아온 문서에는 A라고 적혀 있는데 요약에서 B로 바뀌는 식이죠. 그래서 출처 링크가 붙어 있어도 그 링크를 실제로 열어봐야 합니다.
Q. “출처를 알려줘”라고 하면 확실해지나요?
아니요. 국내 사고 사례가 전부 그 반대를 보여줍니다. 판례번호·논문 제목·학술지 이름은 형식이 정해져 있어서 모델이 가장 그럴듯하게 지어내기 쉬운 형태예요. 출처를 요구하면 출처 모양의 문자열이 나올 뿐, 그게 실존한다는 보장은 없습니다.
Q. 환각과 오류는 다른 건가요?
계산 실수나 오타는 그냥 오류예요. 환각은 근거 자체가 없는 내용을 근거 있는 것처럼 만들어내는 것이라 성격이 다릅니다. 그래서 “다시 계산해봐”로는 안 잡히고, 바깥에서 대조해야 잡혀요.
🚀 그래서 어떻게 쓰면 되나
원인을 알았으니 대응은 단순해집니다. “확신에 찬 어투”를 신뢰 신호로 쓰지 않는 것부터예요. 위에서 봤듯 어투는 정확도와 아무 상관이 없습니다.
그리고 위험한 자리를 미리 알아두면 좋아요. 숫자, 날짜, 고유명사, 법 조문, 판례번호, 논문 제목 — 규칙성이 없어서 학습이 안 되는 정보들이 정확히 환각이 잘 나는 자리입니다. 이 여섯 가지가 답에 들어 있으면 무조건 원본을 확인한다고 정해두는 게 편해요.
질문을 던지는 방식으로도 꽤 줄일 수 있습니다. 프롬프트를 어떻게 쓰느냐에 따라 답의 품질이 달라지는 원칙과 업무에서 어떤 도구를 고를지도 함께 보시면 도움이 될 거예요.
그리고 답을 받아든 다음 실제로 걸러내는 절차는 따로 정리해 뒀습니다. AI 답변에서 위험 신호를 찾아내는 구별법을 이어서 보세요. 이 글이 “왜 생기나”라면, 그 글은 “어떻게 잡아내나”입니다.
참고 자료: OpenAI, Why language models hallucinate (2025) · Huang 외, A Survey on Hallucination in Large Language Models (ACM TOIS) · 법률신문, AI 환각 가짜 판례 대응 보도 (2026)


