JIINSI
논문 브리핑

LLM 에이전트의 '환각 도구 호출', 새로운 방어선으로 막아낸다

한경모글 · 한경모
인공지능 에이전트가 복잡한 데이터베이스와 API 도구들 사이에서 올바른 명령을 처리하거나, 존재하지 않는 도구 호출을 안전하게 무효화하는 과정을 표현한 그래픽 이미지.
인공지능 에이전트가 복잡한 데이터베이스와 API 도구들 사이에서 올바른 명령을 처리하거나, 존재하지 않는 도구 호출을 안전하게 무효화하는 과정을 표현한 그래픽 이미지.
인공지능 에이전트 기술이 빠르게 발전하면서, 이제 LLM(거대 언어 모델)은 단순한 텍스트 생성기를 넘어 스스로 외부 도구를 활용해 복잡한 작업을 수행하는 단계에 이르렀습니다. 웹 검색, 데이터 분석, API 호출 등 다양한 도구를 사용하며 그 활용 범위는 금융, 의료, 자동화 시스템에 이르기까지 무한히 확장되고 있습니다. 그러나 이러한 진화의 이면에는 심각하게 간과되었던 안전성 문제가 도사리고 있었으니, 바로 '환각 도구 호출'입니다. 최근 arXiv에 공개된 연구, 'Closed-World Resolution Against Tool Hallucination in LLM Agents'는 LLM 에이전트의 심각한 취약점을 지적하고 새로운 해결책을 제시합니다. 기존 LLM의 환각은 사실과 다른 정보를 생성하는 것이었습니다. 하지만 도구를 사용하는 LLM 에이전트의 경우, '환각 도구 호출'은 에이전트가 존재하지 않는 도구를 호출하거나, 특정 도구가 요구하는 스키마에 맞지 않는 유효하지 않은 인수를 넘기는 현상을 의미합니다. 이는 단순한 실수 이상의 구조적 문제를 야기합니다. 문제는 기존의 도구 안전성 및 보안 메커니즘이 이러한 환각 도구 호출에 무방비하다는 점입니다. 지금까지의 방어 전략은 크게 두 가지였습니다. 첫째, 여러 도구 중 에이전트가 어떤 도구를 선택하는 것이 가장 적절한지 판단하는 '도구 선택(tool selection)' 기법입니다. 둘째, 에이전트가 실제 도구로 무엇을 할 수 있는지 제한하는 '게이팅(gating)' 메커니즘입니다. 이 두 가지 방법 모두 에이전트가 실제로 존재하는 도구를 호출할 것이라는 전제하에 작동합니다. 하지만 환각 도구 호출은 애초에 존재하지 않는 도구에 대한 것이므로, 어떤 게이트도 이를 차단하거나 올바른 선택을 유도할 수 없습니다. 연구진은 이를 '구조적 맹점(structural blind spot)'이라 일컬으며, 기존 방어 체계의 한계를 명확히 지적합니다. 이 논문은 이러한 맹점을 해결하기 위해 '닫힌 세계 해상도(Closed-World Resolution, CWR)'라는 새로운 방식을 제안합니다. CWR은 다음과 같은 핵심 원칙에 기반합니다:
  • 기존 방식은 실제 도구 호출 중 올바른 것을 선택하거나 위험한 것을 차단하는 데 중점
  • 하지만 LLM 에이전트는 존재하지 않는 도구를 호출하거나 유효하지 않은 인수를 넘기는 '도구 환각'을 일으킴
  • 이는 기존 보안 메커니즘이 가정하는 '실제 도구'의 범주를 벗어나므로 방어 불가능한 '구조적 맹점'으로 작용
  • 이 논문은 '닫힌 세계 해상도(CWR)'를 제안, 유효하지 않은 호출을 '작동 없음(no-op)'으로 전환하거나 유효한 기본값으로 재조정하여 안전하게 실패 처리
CWR은 유효하지 않은 도구 호출을 단순히 거부하는 대신, 이를 '작동 없음(no-op)' 도구로 해석하거나, 유효한 기본값으로 인수를 재조정하여 '오류 복구(failure recovery)'를 가능하게 합니다. 이는 에이전트가 예측 불가능한 오류 상태에 빠지는 대신, 통제된 방식으로 '안전하게 실패'할 수 있도록 돕는 것입니다. 예를 들어, 존재하지 않는 '데이터 삭제' 도구를 호출하려 할 때, CWR은 이를 안전하게 무효화하여 시스템 오작동을 방지할 수 있습니다. 일각에서는 LLM의 성능이 고도화되면 이러한 환각 문제도 자연스레 줄어들 것이라고 주장할 수 있습니다. 그러나 이는 단순히 모델의 추론 능력 향상만으로는 해결될 수 없는 근본적인 시스템 설계 문제입니다. 아무리 똑똑한 에이전트라도, 유효하지 않은 요청이 들어왔을 때 이를 안전하게 처리할 수 있는 구조적 방어막이 필요합니다. CWR은 이러한 측면에서 에이전트의 신뢰성과 안정성을 한 차원 높이는 중요한 기반 기술이 될 수 있습니다. 이러한 연구는 오픈AI, 구글, 앤트로픽 등 LLM 에이전트를 개발하는 모든 기업에게 필수적인 고려 사항이 될 것입니다. 특히 금융 거래, 의료 진단, 자율주행 등 고위험 애플리케이션에 LLM 에이전트가 도입될수록, 작은 오류가 치명적인 결과를 초래할 수 있습니다. 업계 전문가들은 인공지능 안전성이 기술 발전만큼이나 중요하다고 입을 모으며, 이번 연구는 AI 시스템이 실제 세상에 안전하게 통합될 수 있도록 돕는 실질적인 진전으로 평가될 수 있습니다. CWR과 같은 메커니즘은 앞으로 LLM 에이전트 아키텍처의 표준 구성 요소로 자리 잡을 가능성이 높습니다.
인사이트

LLM 에이전트가 존재하지 않는 도구를 호출하는 '환각 도구 호출'은 기존의 안전 메커니즘으로 막을 수 없는 구조적 맹점이며, '닫힌 세계 해상도'는 이를 안전하게 무효화하여 에이전트의 신뢰성을 근본적으로 향상시키는 중요한 돌파구입니다.

자주 묻는 질문

LLM 에이전트가 도구를 잘못 부르는 게 그렇게 흔한 일인가요?
네, 생각보다 자주 발생합니다. 특히 에이전트가 복잡한 상황에서 도구를 사용하거나, 도구 스키마를 완전히 이해하지 못할 때 존재하지 않는 도구를 생성하거나 유효하지 않은 인수를 전달하려는 시도를 보일 수 있습니다. 이는 모델 자체의 한계와 외부 환경의 복잡성 때문에 발생합니다.
이 기술(닫힌 세계 해상도)이 실제로 에이전트의 오작동을 얼마나 줄일 수 있을까요?
이 기술은 에이전트가 '존재하지 않는' 도구를 호출하거나 '유효하지 않은' 인수를 전달하려는 시도를 안전하게 처리함으로써 치명적인 시스템 오작동을 방지하는 데 크게 기여할 수 있습니다. 이는 시스템의 신뢰성과 견고성을 높여 예상치 못한 오류로 인한 서비스 중단이나 보안 위협을 줄여줍니다. 모든 종류의 오류를 막는 것은 아니지만, 이전에 다뤄지지 않던 중요한 실패 모드를 방어합니다.
AI 안전성 문제와 어떤 관련이 있나요?
AI 안전성은 LLM 에이전트가 의도치 않은 해를 끼치지 않도록 보장하는 광범위한 분야입니다. '닫힌 세계 해상도'는 에이전트가 외부 도구와 상호작용할 때 발생할 수 있는 잠재적 위험 중 하나인 '환각 도구 호출'을 해결함으로써 AI 시스템의 전반적인 안전성을 강화합니다. 이는 특히 실제 환경에 배치되는 고위험 AI 애플리케이션에서 매우 중요하게 고려됩니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.