JIINSI
논문 브리핑

AI, '기억 신뢰 격차'에 빠지다: 대규모 모델일수록 오래된 정보를 맹신하는 역설

한경모글 · 한경모
개인의 데이터를 축적하고 학습하는 AI 에이전트의 모습을 형상화한 이미지. 에이전트가 기억하는 정보와 외부의 새로운 지식이 혼재되어 있다.
개인의 데이터를 축적하고 학습하는 AI 에이전트의 모습을 형상화한 이미지. 에이전트가 기억하는 정보와 외부의 새로운 지식이 혼재되어 있다.
인공지능 시대를 맞아, 개인화된 AI 에이전트의 등장은 많은 기대를 모으고 있습니다. 사용자와 지속적으로 상호작용하며 경험을 축적하고, 고유의 지식을 기억해 맞춤형 서비스를 제공하는 것이 핵심이죠. 그러나 최근 arXiv에 게재된 논문 "The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents"는 이러한 '지속적 기억(Persistent Memory)' 기반 AI 에이전트의 치명적인 약점을 파고들어 AI 개발자들에게 중요한 경고를 던집니다. 바로 모델의 능력이 향상될수록 오래된, 심지어 틀린 정보마저 맹신하는 경향이 커진다는 역설적인 발견입니다. 이 논문은 대규모 언어 모델(LLM)이 지속적인 기억을 활용할 때 발생하는 '기억 신뢰 격차(Memory Trust Gap)' 현상을 심도 깊게 분석했습니다. 연구진은 Qwen3 모델의 다양한 크기(0.6B, 1.7B, 4B, 8B)를 활용하여 PlanBench-XL이라는 벤치마크에서 모델의 성능을 측정했습니다. 이 벤치마크는 두 가지 주요 스위트로 구성됩니다.
  • Benefit 스위트: 저장된 기억(fact)이 없이는 해결할 수 없는 문제들로, 모델이 기억을 활용해야만 정답을 찾을 수 있습니다.
  • Safety 스위트: 외부의 권위 있는 도구(authoritative tool)가 항상 올바른 값을 제공하지만, 모델의 내부에 저장된 오래된 기억이 이와 상충할 수 있는 문제입니다. 이 경우 모델은 외부의 최신 정보를 우선해야 합니다.
연구 결과는 충격적입니다. Benefit 스위트에서는 예상대로 모델 크기가 커질수록 성능이 향상되어 기억을 효과적으로 활용하는 경향을 보였습니다. 그러나 Safety 스위트에서는 반대의 현상이 나타났습니다. 모델의 크기가 커지고 능력이 향상될수록, 즉 8B와 같은 더 큰 모델일수록, 오래되고 잘못된 내부 기억을 맹신하여 외부의 정확하고 권위 있는 정보를 무시하는 경향이 더욱 두드러졌습니다. 이는 작은 모델이 오히려 외부 정보를 더 잘 받아들여 정답을 맞히는 것과 대조적입니다. 이러한 '기억 신뢰 격차'는 단순히 데이터 관리의 문제를 넘어섭니다. 모델이 지식을 통합하고 추론하는 방식에 내재된 근본적인 문제일 수 있다는 것이 업계 전문가들의 중론입니다. 검색 증강 생성(RAG)과 같은 기술이 오래된 지식을 제공할 위험을 줄여주지만, 이 연구는 모델 자체의 '인식론적 신뢰(epistemic trust)' 판단 능력에 결함이 있음을 시사합니다. 즉, AI가 단순히 정보를 찾아오는 것을 넘어, 그 정보의 신뢰성과 최신성을 스스로 판단하는 데 어려움을 겪는다는 것입니다. 이는 자율주행, 의료 진단, 금융 상담과 같이 정확한 정보와 판단이 생명과 직결되는 AI 애플리케이션에서 심각한 안전 문제를 야기할 수 있습니다. 일부에서는 모델 학습 시 데이터의 신선도 유지나 RAG 시스템의 개선을 통해 충분히 해결 가능한 문제라고 주장할 수 있습니다. 하지만 본 연구는 단순한 데이터 업데이트를 넘어, 모델이 '어떤 정보가 더 신뢰할 만한가?'를 판단하는 내재된 추론 능력의 한계를 지적합니다. 더욱이 모델 규모가 커질수록 이러한 문제가 악화된다는 점은 단순히 모델을 키우는 것만으로는 이 문제를 해결할 수 없음을 의미합니다. 앞으로 AI 연구는 모델의 지식과 기억을 관리하고, 새로운 정보의 권위를 판단하는 '인식론적 겸손함(epistemic humility)'을 가르치는 데 집중해야 할 것입니다. 정보의 최신성 검증 메커니즘, 출처 기반의 신뢰도 평가, 그리고 자기 수정 능력을 갖춘 AI 개발이 시급한 과제로 떠오르고 있습니다.
인사이트

더욱 강력해진 대규모 언어 모델이 오히려 오래된 정보를 맹신하는 '기억 신뢰 격차' 현상을 보이며, 이는 단순히 데이터 업데이트를 넘어 AI의 근본적인 인식론적 추론 능력 한계와 관련되어 있어 AI 안전과 신뢰성 확보에 중대한 과제를 제시합니다.

자주 묻는 질문

AI가 오래된 정보를 과신한다는 게 무슨 뜻인가요?
AI가 과거에 학습하거나 저장한 정보가 현재의 정확한 정보와 충돌할 때, 새로운 정보 대신 오래된 정보를 더 신뢰하고 따르는 현상을 말합니다. 이는 특히 개인화된 AI 에이전트가 지속적으로 사용자와 상호작용하며 기억을 축적할 때 발생할 수 있습니다.
더 큰 AI 모델이 오히려 오래된 정보를 맹신한다니, 이해가 안 가네요. 더 똑똑한 거 아닌가요?
일반적으로 모델 크기가 클수록 다양한 태스크에서 더 높은 성능을 보이지만, 이 연구에서는 '정보의 신뢰성 판단'이라는 특정 영역에서 예외적인 경향을 발견했습니다. 더 큰 모델은 자신 내부에 저장된 정보에 대한 '과도한 신뢰'를 보여, 외부의 새로운 권위 있는 정보를 배척하는 역설적인 상황이 나타났습니다.
이런 문제, 결국 해결될 수 있을까요? 앞으로 AI 개발 방향은 어떻게 될까요?
이 문제는 AI의 안전성과 신뢰성 확보에 매우 중요한 과제입니다. 단순히 데이터를 업데이트하는 것을 넘어, AI가 정보의 출처와 최신성을 스스로 판단하고, 필요에 따라 자신의 지식을 의심하며 외부 정보의 권위를 인정하는 '인식론적 겸손함'을 갖추도록 하는 연구가 활발히 진행될 것으로 보입니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.