한경모의 논문 노트 · 2026-09-26
AI의 '확신에 찬 거짓말', 이중 덫으로 잡는다는 발상에 대하여
AI가 그럴싸한 거짓말을 확신에 차서 내뱉는 환각 현상은 신뢰를 무너뜨리는 고질병입니다. 최근 이를 바로잡기 위해 AI 스스로의 '확신'과 '불확실성'을 역이용하는 이중 장치가 제안되었지만, 우리는 그 작동 원리와 명백한 한계를 먼저 짚어봐야 합니다.

“AI의 지능보다 중요한 것은 AI의 정직함일 수 있습니다. 모르면 모른다고 말하는 능력이야말로, 우리가 기계와 의미 있는 협업을 하기 위한 최소한의 전제 조건입니다.”
그럴싸해서 더 위험한, AI의 '확신범' 문제
AI가 엉뚱한 답을 내놓는 '환각(Hallucination)' 현상은 이제 많은 분께 익숙한 문제입니다. 하지만 모든 환각이 똑같이 위험한 것은 아닙니다. 신입사원 두 명에게 어려운 업무를 맡겼다고 가정해 보겠습니다. 한 명은 잘 모르겠다며 선배에게 솔직히 물어봅니다. 다른 한 명은 아는 척하며 그럴싸한 보고서를 꾸며냅니다. 둘 중 누가 더 조직에 큰 문제를 일으킬까요? 당연히 후자입니다. AI의 환각도 마찬가지입니다. 어설프게 틀리는 것보다, 실제 사실인 양 확신에 찬 어조로 유창하게 거짓을 말하는 경우가 훨씬 치명적입니다.
최근 주목받는 멀티모달 대규모 언어 모델(MLLM)의 등장은 이 문제를 더 심각하게 만들었습니다. MLLM은 쉽게 말해 ‘글과 그림, 소리까지 함께 이해하는 AI’입니다. 예전 AI가 텍스트만 읽었다면, 이제는 엑스레이 사진을 보고 진단 소견을 텍스트로 써주거나, 복잡한 재무제표 그래프를 해석해 요약 보고서를 만드는 일까지 넘봅니다. 만약 이런 AI가 엑스레이 사진의 희미한 암세포를 놓치고 ‘정상 소견’이라는 확신에 찬 보고서를 내놓거나, 재무 그래프의 하락 신호를 무시하고 ‘긍정적 전망’을 제시한다면 그 피해는 상상하기 어렵습니다. AI의 실수는 더는 가벼운 웃음거리가 아니라, 실제 현실에 직접적인 피해를 주는 ‘사고’가 될 수 있습니다.
이처럼 AI의 ‘확신에 찬 오답’은 모델의 신뢰도를 뿌리부터 흔드는 문제입니다. 자율주행차가 장애물을 ‘확신을 갖고’ 빈 공간으로 인식하는 순간, 법률 AI가 독소 조항을 ‘확신을 갖고’ 유리한 조항으로 해석하는 순간, AI는 유용한 도구가 아니라 예측 불가능한 시한폭탄이 됩니다. 학계와 산업계가 이 문제에 필사적으로 매달리는 이유입니다. 다만 연구는 정확히 읽어야 합니다. 최근 이 문제를 해결할 실마리로 제시된 DEEPO라는 연구 역시, 그 원리를 정확히 이해하고 한계부터 보는 것이 중요합니다.
AI를 훈련시키는 ‘당근과 채찍’, 왜 엉뚱한 곳에서 막히나
AI의 환각을 줄이기 위해 널리 쓰이는 방법 중 하나가 ‘강화 학습(Reinforcement Learning, RL)’입니다. 처음 듣는 분들을 위해 쉽게 비유해 보겠습니다. 강아지에게 ‘앉아’ 훈련을 시키는 과정과 비슷합니다. 강아지가 우연히 앉는 시늉을 하면 간식(보상)을 주고, 엉뚱한 행동을 하면 반응하지 않거나 낮은 톤으로 제지(벌)합니다. 이 과정을 반복하면 강아지는 간식을 얻기 위해 스스로 ‘앉는’ 행동을 더 자주 하게 됩니다. 강화 학습은 AI를 이런 식으로 훈련시키는 방법입니다. AI에게 어떤 답을 생성하게 한 뒤, 그 답이 좋으면 ‘당근’에 해당하는 높은 점수를, 나쁘면 ‘채찍’에 해당하는 낮은 점수를 줘서 스스로 더 나은 답을 만드는 법을 터득하게 하는 것입니다.
그런데 이 ‘당근과 채찍’ 방식이 MLLM의 환각, 특히 ‘확신에 찬 오답’ 앞에서는 제대로 작동하지 않는다는 사실이 밝혀졌습니다. 최근 공개된 ‘DEEPO’ 논문은 기존 강화 학습의 수정 과정에 두 가지 치명적인 약점이 있다고 지적합니다.
첫 번째 약점은 ‘답이 너무 어려울 때’ 발생합니다. 아주 어려운 질문을 던지면 AI 모델도 여러 가지 답을 탐색해 봅니다. 이때 운 나쁘게 탐색한 답들이 모두 만장일치로 틀리는 경우가 생깁니다. 회사로 치면, 난해한 과제를 받은 신입사원 팀 전체가 머리를 맞대고 고민했지만 결국 다 같이 엉뚱한 결론을 내놓은 상황입니다. 기존 강화 학습은 이럴 때 곤란한 처지에 빠집니다. ‘모두 똑같이 틀렸으니 누구 하나 딱히 더 잘하거나 못하지 않았다’고 판단해, 보상도 벌점도 아닌 0점을 줘버립니다. 학습 신호가 사라지는 것입니다. 가장 학습이 절실한, 가장 어려운 문제 앞에서 AI는 아무것도 배우지 못하고 멈춰 서게 됩니다.
두 번째 약점은 더 교활한 문제입니다. 바로 ‘확신에 찬 오답’이 학습 시스템의 눈을 속이는 현상입니다. 앞서 비유한 ‘아는 척하는 신입사원’을 떠올려 보십시오. 그는 너무나 자신감 넘치는 태도와 유창한 말솜씨로 틀린 보고를 합니다. 관리자의 피드백 시스템이 머뭇거리거나 주저하는 실수(예: “아마도… 그럴 것 같습니다”)는 잘 잡아내지만, 이처럼 확신에 찬 실수는 ‘뭔가 근거가 있겠지’라며 놓치기 쉽습니다. AI 학습 과정도 비슷합니다. AI가 어떤 단어를 낮은 확률로 주저하며 선택했다가 틀리면, 강화 학습은 ‘아, 이건 실수구나’라고 인지하고 바로잡습니다. 하지만 아주 높은 확률로, 즉 ‘강한 확신’을 갖고 틀린 단어를 내뱉으면, 학습 알고리즘의 계산 과정(기울기 계산)에서 이 실수가 마치 없는 것처럼 거의 반영되지 않고 지나가 버립니다. AI는 자기가 뭘 틀렸는지도 모른 채 같은 실수를 반복하게 됩니다.
실수에서 배우는 새로운 방법, '이중 엔트로피'라는 덫
DEEPO 연구는 바로 이 두 가지 약점을 정면으로 겨냥합니다. 해법의 핵심은 ‘엔트로피(Entropy)’라는 개념을 활용해 일종의 ‘이중 덫’을 놓는 것입니다. 여기서 엔트로피란, 정보이론에서 빌려온 개념이지만 AI 분야에서는 ‘모델의 예측이 얼마나 불확실한가’를 나타내는 수치로 이해하면 쉽습니다. 예를 들어 회식 메뉴를 정하는데 모두가 “무조건 삼겹살!”이라고 외친다면, 의견이 하나로 모여 불확실성이 낮습니다. 이것이 ‘낮은 엔트로피’ 상태입니다. 반면 누군가는 삼겹살, 누군가는 파스타, 다른 누군가는 회를 먹자고 의견이 분분하다면, 다음 행동을 정하기 어려운 불확실한 상태입니다. 이것이 ‘높은 엔트로피’입니다. AI가 다음 단어를 예측할 때도 마찬가지입니다. 특정 단어를 ‘확신’하면 엔트로피가 낮고, 여러 단어를 두고 ‘고민’하면 엔트로피가 높습니다.
DEEPO는 이 엔트로피 값을 AI 훈련을 위한 ‘당근과 채찍’ 설계에 아주 영리하게 활용합니다.
첫 번째 덫는 ‘만장일치 오답’ 문제를 해결합니다. 기존 방식처럼 틀린 답들끼리 비교해 우열을 가리는 대신, DEEPO는 모델이 답을 생성할 때 보인 ‘불확실성(높은 엔트로피)’에 주목합니다. 만약 모델이 잔뜩 고민하다가(높은 엔트로피) 결국 틀린 답을 냈다면, “그렇게 고민하고도 틀렸어? 이건 정말 잘못된 방향이야”라며 더 강한 벌점을 줍니다. 반면, 고민 없이(낮은 엔트로피) 틀린 답을 냈다면 상대적으로 약한 벌점을 줍니다. 이렇게 하면 ‘만장일치 오답’ 상황에서도 학습 신호가 0이 되는 것을 막고, 오히려 모델이 가장 헷갈려하는 지점에서 더 효과적으로 학습하도록 유도할 수 있습니다.
두 번째 덫은 ‘확신에 찬 오답’을 직접 겨냥합니다. DEEPO는 AI가 ‘낮은 엔트로피(높은 확신)’ 상태에서 ‘오답’을 내놓는 조합을 집중적으로 찾아내어 강력한 페널티를 부과하는 장치를 추가했습니다. 이는 마치 “네가 그렇게 자신만만하게 말했는데, 틀렸잖아! 이건 아주 큰 실수야!”라고 명확히 지적해주는 것과 같습니다. 기존 학습 방식에서는 그냥 지나쳤을 이 ‘확신범’적 실수가 이제는 학습 과정에 명확히 포착되어, AI가 자신의 과신을 수정하도록 강제합니다.
이 두 가지 접근법을 표로 정리하면 차이가 더 명확히 보입니다.
| 상황 (Situation) | 기존 강화 학습 (PPO 등) | DEEPO의 접근법 |
|---|---|---|
| 어려운 질문에 모두 틀린 답을 낼 때 | 답들끼리 우열을 가릴 수 없어 학습 신호가 0이 됨 (학습 정체) | 모든 오답에 대해 벌점을 부여하고, 특히 모델이 불확실(고엔트로피)할 때 더 강한 학습 신호를 줌 |
| 틀린 답을 매우 확신하며 내뱉을 때 | 확신이 강해 실수로 인지되지 않고, 학습 과정에서 그냥 지나침 (기울기 소실) | '낮은 엔트로피(높은 확신) + 오답' 조합을 직접 겨냥해 큰 벌점을 부과하여 실수를 명확히 교정 |
| 보상 신호 설계 | 생성된 답안 그룹 내에서의 상대적 우위(Advantage)에 초점 | 모델의 '확신 수준(엔트로피)'과 '정답 여부'를 모두 고려한 이중 보상 구조 |
결국 DEEPO는 AI가 단순히 정답을 맞히게 하는 것을 넘어, 자신의 ‘앎’과 ‘모름’을 스스로 구분하고, 특히 ‘잘못된 확신’을 경계하도록 훈련시키는 새로운 패러다임을 제시한 셈입니다.
흔한 오해들, 그리고 재현 가능성에 대한 질문
새로운 기술이 등장하면 으레 장밋빛 전망이 쏟아집니다. 하지만 연구는 정확히 읽어야 합니다. DEEPO가 AI 환각 문제에 의미 있는 진전을 이룬 것은 사실이지만, 이를 둘러싼 몇 가지 흔한 오해는 바로잡고 넘어가야 합니다.
첫 번째 오해는 ‘DEEPO가 AI 환각을 완전히 해결했다’는 성급한 결론입니다. 그렇지 않습니다. DEEPO는 강화 학습이라는 특정 훈련 방법론 안에서 발생하는 두 가지 문제, 즉 ‘만장일치 오답으로 인한 학습 정체’와 ‘확신에 찬 오답을 놓치는 문제’를 개선하는 데 특화된 기술입니다. AI 환각의 원인은 매우 다양합니다. 애초에 학습한 데이터에 편향이나 오류가 있었을 수도 있고, 이미지의 아주 미세한 디테일을 잘못 인식해서 엉뚱한 설명을 만들어낼 수도 있습니다. DEEPO는 이런 모든 종류의 환각을 해결하는 만병통치약이 아닙니다. 특정 증상에 효과가 좋은 전문 치료제에 가깝습니다.
두 번째 오해는 ‘이제 AI를 의료나 법률 같은 고신뢰 분야에 바로 적용해도 된다’는 기대입니다. 이는 매우 위험한 생각입니다. 모든 학술 논문은 기본적으로 통제된 실험실 환경에서의 결과물입니다. 연구진이 설계한 특정 데이터셋과 평가 기준(벤치마크)에서는 성능 향상을 보였지만, 실제 현장에서 마주칠 예측 불가능하고 변화무쌍한 문제들 앞에서도 동일한 성능을 유지할지는 아무도 모릅니다. 여기서 제 오랜 화두가 등장합니다. ‘재현되는가, 조건은 무엇인가.’ 다른 연구팀이 다른 AI 모델과 데이터로 이 실험을 했을 때도 똑같은 결과가 나올까요? 강화 학습은 특히 훈련 과정이 복잡하고 변수가 많아, 때로는 불안정한 결과를 낳는 양날의 검이기도 합니다. 하나의 논문 결과를 가지고 상용화나 현장 적용을 논하는 것은 예언의 영역이지, 과학의 영역이 아닙니다.
따라서 우리는 DEEPO를 환각 문제의 종결자가 아니라, AI가 더 정직해질 수 있는 가능성을 보여준 하나의 중요한 이정표로 봐야 합니다. 이 연구가 제시한 ‘엔트로피를 활용한 자기 성찰적 훈련’이라는 아이디어는 분명 다른 연구자들에게 큰 영감을 줄 것이고, 앞으로 더 정교하고 안정적인 기술로 발전해 나갈 것입니다. 그 과정을 꾸준히 지켜보는 것이 올바른 자세입니다.
메커니즘과 예언의 구분: DEEPO가 던지는 묵직한 질문
하나의 기술 논문을 깊이 파고드는 이유는, 그 안에 담긴 작동 원리, 즉 메커니즘을 이해함으로써 더 큰 흐름을 읽기 위함입니다. DEEPO의 메커니즘은 단순히 AI의 오답률을 몇 퍼센트 낮췄다는 숫자 너머의 시사점을 던집니다. 그것은 바로 ‘AI의 자기 인식(Self-Awareness)’에 대한 질문입니다.
지금까지의 AI 개발이 ‘더 똑똑한 AI’, 즉 정답률이 높은 AI를 만드는 데 집중했다면, DEEPO와 같은 연구는 ‘더 정직한 AI’를 향한 중요한 전환을 보여줍니다. 정직한 AI란, 자신이 아는 것과 모르는 것을 구분하고, 모를 때는 모른다고 말할 수 있는 AI입니다. 더 나아가 자신이 내놓은 답에 대해 어느 정도의 확신을 갖고 있는지 스스로 평가하고 그 정보를 사용자에게 투명하게 전달할 수 있는 AI입니다.
이는 마치 초기 검색 엔진의 역사와도 평행선을 그립니다. 1990년대의 검색 엔진은 그저 질의어와 관련된 웹페이지 목록을 순서대로 나열해 줄 뿐이었습니다. 사용자는 그 목록 속에서 옥석을 직접 가려내야 했습니다. 하지만 오늘날의 검색 엔진은 어떤가요? 직접적인 답변을 상단에 보여주거나, ‘다른 사용자가 함께 찾은 질문’ 등을 제시하며 사용자의 질문이 가진 불확실성을 해소하려 노력합니다. 단순히 정보의 연결고리 역할을 넘어, 정보의 신뢰도를 가늠하고 사용자의 의도를 더 깊이 이해하려는 방향으로 진화한 것입니다. DEEPO의 접근법도 AI가 단순한 ‘답변 생성기’에서, 자신의 답변에 대한 신뢰도까지 함께 제공하는 ‘신중한 조언자’로 진화하는 과정의 일부로 볼 수 있습니다.
이러한 진화는 결국 ‘데이터 주권’과 ‘신뢰 사회’라는 묵직한 주제와 연결됩니다. 우리가 AI의 답변을 무조건 믿을 수 없다면, 그로 인해 발생하는 문제의 책임은 누가 져야 할까요? AI를 사용한 개인일까요, AI를 개발한 기업일까요? 법적, 윤리적 논쟁은 끝이 없을 것입니다. 이 문제의 근본적인 해결책 중 하나는 AI 스스로가 더 책임감 있는 답변을 생성하도록 만드는 것입니다. DEEPO가 보여준 것처럼, AI가 자신의 불확실성을 인지하고 ‘확신에 찬 거짓말’을 스스로 제어할 수 있게 된다면, 우리는 비로소 AI를 단순한 도구가 아닌 신뢰할 수 있는 파트너로 받아들일 수 있을 것입니다. AI의 지능을 높이는 경쟁만큼이나, AI의 신뢰도를 높이는 경쟁이 중요한 이유입니다.
독자가 던질 법한 질문들
Q. DEEPO라는 기술이 제 스마트폰 AI 비서에도 곧 적용되나요? A. 바로 적용되기는 어렵습니다. DEEPO는 아직 연구 단계의 기술이며, 실제 상용 제품에 탑재되려면 안정성, 효율성, 다른 시스템과의 호환성 등 많은 검증을 거쳐야 합니다. 특히 강화 학습은 훈련 비용과 시간이 많이 들기 때문에, 기업들이 도입을 결정하기까지는 신중한 접근이 필요합니다. 다만 이러한 연구 결과는 오픈AI, 구글 등 빅테크 기업들의 차세대 모델 개발에 중요한 영감을 줄 것입니다.
Q. AI 환각을 줄이는 다른 방법은 없나요? 왜 강화 학습에 주목하는 건가요? A. 물론 다른 방법도 많습니다. 더 좋은 데이터를 많이 학습시키는 방법, 모델이 답을 생성할 때 사실관계를 검증하는 별도 장치(검색 엔진 연동 등)를 붙이는 방법 등이 있습니다. 하지만 강화 학습에 주목하는 이유는, 모델 스스로 ‘좋은 답’이 무엇인지 판단하는 능력을 내재화할 수 있기 때문입니다. 외부 장치에 의존하는 것은 응급처치에 가깝다면, 강화 학습은 AI의 체질 자체를 개선하려는 시도에 비유할 수 있습니다. DEEPO는 그 체질 개선 과정의 비효율을 수술한 셈입니다.
Q. '엔트로피'라는 개념이 너무 어렵습니다. 더 쉽게 설명해 주실 수 있나요? A. 물론입니다. 회식 메뉴를 정하는 상황을 생각해 보십시오. 모두가 “무조건 삼겹살!”이라고 외친다면, 의견이 하나로 모였으니 불확실성이 낮습니다. 이것이 ‘낮은 엔트로피’ 상태입니다. 반면, 누군가는 삼겹살, 누군가는 파스타, 다른 누군가는 회를 먹자고 해서 의견이 분분하다면, 다음 행동을 정하기 어려운 불확실한 상태입니다. 이것이 ‘높은 엔트로피’입니다. AI가 다음 단어를 예측할 때도 마찬가지입니다. 특정 단어를 ‘확신’하면 엔트로피가 낮고, 여러 단어를 두고 ‘고민’하면 엔트로피가 높습니다. DEEPO는 이 ‘확신’과 ‘고민’의 정도를 AI 훈련에 역으로 이용하는 것입니다.
이 브리핑이 유용했나요?
댓글 (0)
첫 댓글을 남겨주세요.