한경모의 논문 노트 · 2026-07-24
AI 비서가 내 돈을 맘대로? 94.9% 막는다는 '넥서스'의 명암
AI가 스스로 판단해 실제 행동까지 하는 '에이전트' 시대가 열리고 있습니다. 스스로 결제하고 시스템을 바꾸는 AI의 위험을 94.9%의 정확도로 막는다는 '넥서스' 연구가 주목받지만, 이 숫자를 맹신해선 안 됩니다.

“기술의 발전을 환호하되, 그 그림자를 냉정하게 직시하는 자세가 그 어느 때보다 필요한 시점입니다.”
인공지능(AI) 비서가 당신의 허락 없이 항공권을 예약하고, 주식 계좌에서 멋대로 돈을 빼내 투자하는 장면. 얼마 전까지 공상과학 영화의 단골 소재였지만, 이제는 현실의 문턱에 와 있습니다. 단순히 글을 쓰거나 그림을 그려주는 것을 넘어, 외부 도구를 사용해 실제 세상에 영향을 미치는 AI, 이른바 'LLM 에이전트'가 등장했기 때문입니다.
다만 연구는 정확히 읽어야 합니다. 최근 발표된 '넥서스(NEXUS)'라는 연구는 이런 위험한 행동을 AI가 수행하기 전에 94.9%의 정확도로 잡아낸다고 발표해 큰 기대를 모았습니다. 그러나 이 숫자의 이면을 들여다보면, 우리는 기술의 가능성만큼이나 그것이 마주한 한계와 앞으로의 과제를 더 냉정하게 봐야 합니다. 자극적 제목에 휘둘리지 않고, 이 기술의 원리와 한계, 그리고 진짜 중요한 시사점을 짚어보겠습니다.
1. 똑똑한 비서인가, 시한폭탄인가: '도구 쓰는 AI'의 본질
우선 '도구를 사용하는 LLM 에이전트'가 무엇인지부터 쉽게 풀어보겠습니다. 기존의 챗GPT 같은 LLM(Large Language Model, 거대 언어 모델)은 세상과 격리된 '뇌'와 같았습니다. 질문에 답하고 글을 쓸 수는 있지만, 직접 팔다리를 움직여 무언가를 할 수는 없었죠. 마치 세상 물정 모르는 수재가 방 안에 갇혀 책만 읽는 것과 비슷합니다.
그런데 이 '뇌'에 '손발'을 달아준 것이 바로 '도구 사용 에이전트'입니다. 여기서 '도구'란 API(Application Programming Interface, 응용 프로그램 인터페이스)를 뜻합니다. 말이 어렵지만, 식당의 키오스크나 앱의 '주문하기' 버튼 같은 것이라 생각하면 쉽습니다. 우리는 키오스크 내부의 복잡한 원리를 몰라도 버튼만 누르면 주방에 주문이 들어가는 것처럼, AI도 API라는 버튼을 눌러 외부 서비스(항공권 예약, 온라인 쇼핑, 이메일 발송 등)를 이용할 수 있게 된 것입니다.
문제는 이 AI 비서가 너무 의욕이 넘치거나, 우리의 말을 잘못 알아들을 때 발생합니다. "요즘 피곤한데 제주도나 갈까"라는 혼잣말을 듣고 AI가 곧바로 환불 불가 항공권을 결제해버릴 수 있습니다. 해커가 AI를 속여 개인정보를 빼내거나 금융 시스템에 접근하도록 조종할 수도 있습니다. 이런 고위험(high-impact) 행동은 되돌릴 수 없는 금전적, 사회적 피해를 낳기에, AI 에이전트의 대중화에 가장 큰 걸림돌이었습니다.
2. '넥서스'는 어떻게 AI의 실수를 막는가: 단순 차단이 아닌 '지능형 관제탑'
이런 배경에서 등장한 '넥서스'는 AI 에이전트의 행동을 실시간으로 감시하는 '안전 관제탑' 역할을 합니다. 기존의 안전장치가 단순히 위험해 보이는 키워드가 포함되면 무조건 행동을 '차단(block)'하는 식이었다면, 넥서스는 훨씬 정교한 방식으로 개입합니다. 마치 교통경찰이 도로 상황에 따라 직진 허용, 서행, 우회 지시, 통행 차단 등 다양한 수신호를 보내는 것과 같습니다.
넥서스는 AI의 행동 계획을 보고 다음 네 가지 중 하나를 결정합니다.
- 허용(Allow): 명백히 안전하고 의도에 맞는 행동입니다. 예를 들어 '오늘 날씨 알려줘'라는 요청에 AI가 날씨 API를 사용하는 것은 문제없다고 판단하고 즉시 허용합니다.
- 확인 요청(Request Confirmation): 행동 자체는 타당해 보이지만, 결과가 중대하거나 비용이 클 때 사용자에게 다시 한번 의사를 묻습니다. "100만 원짜리 그래픽카드 구매하기" 같은 명령에 대해, AI가 결제 API를 쓰기 전에 "정말 결제할까요?"라고 사용자에게 확인을 요청하는 식입니다.
- 수정 요청(Request Revision): 사용자의 의도와는 다르지만, 약간만 수정하면 괜찮은 행동일 때 AI에게 계획을 수정하라고 요구합니다. 가령 '내일 회의 자료를 팀원들에게 보내줘'라고 했는데, AI가 회사 외부인의 이메일 주소까지 포함했을 경우, "외부인은 제외하고 다시 계획을 짜세요"라고 지시하는 것입니다.
- 차단(Block): 명백히 위험하거나 금지된 행동입니다. 예를 들어 '회사 데이터베이스를 모두 삭제해' 같은 명령은 사용자의 확인 여부와 상관없이 무조건 막습니다.
이런 판단은 크게 세 가지 장치를 통해 이뤄집니다. 첫째는 '결정론적 안전 규칙'으로, 마치 회사의 복무 규정처럼 '절대 안 되는 일'을 명시한 목록입니다. 둘째는 '인자 수준 검사'인데, 이는 AI가 사용하려는 도구의 세부 내용을 살피는 것입니다. 결제 API를 쓴다면 금액이 얼마인지, 수신인이 누구인지 등을 따져보는 '영수증 검사'와 같습니다. 마지막으로 이 모든 정보를 종합해 '위험 점수'를 매기는 확률 모델을 사용합니다. 이는 경험 많은 관리자가 신입사원의 업무 계획서를 보고 직감적으로 위험을 감지하는 것과 유사합니다.
이처럼 넥서스는 단순히 '된다/안된다'를 넘어, AI와 소통하며 위험을 관리하는 협력적 안전망을 지향한다는 점에서 기존 방식과 근본적인 차이가 있습니다.
3. 94.9%라는 숫자의 함정: 운전면허시험과 실제 도로 주행의 차이
연구팀은 넥서스가 94.9%의 F1 점수를 기록했다고 발표했습니다. 여기서 F1 점수란, AI의 판단이 얼마나 정확한지를 나타내는 종합 성적표입니다. 위험한 행동을 '위험하다'고 잘 잡아내는 능력(재현율)과, 안전한 행동을 '위험하다'고 잘못 판단하지 않는 능력(정밀도)을 종합해 계산합니다. 김치를 담글 때, 썩은 배추는 기가 막히게 골라내면서(재현율), 멀쩡한 배추는 하나도 버리지 않는(정밀도) 주부의 솜씨를 수치화한 것이라 비유할 수 있습니다.
94.9%는 분명 높은 수치입니다. 하지만 연구는 정확히 읽어야 합니다. 이 결과는 '합성 벤치마크'라는 통제된 환경에서, 단 128개의 가상 시나리오를 통해 얻어진 것입니다. 이는 마치 운전면허 기능시험장에서 정해진 코스를 완벽하게 통과한 것과 같습니다. 실제 서울 강남의 퇴근길처럼 예측 불가능한 돌발 상황이 가득한 '실제 도로'에서는 성능이 어떻게 나올지 아무도 모릅니다.
과거 비슷한 사례는 많았습니다. 자율주행 기술 초기에도 시뮬레이션 환경에서는 99.9%의 완벽한 주행 능력을 보였지만, 실제 도로에서 햇빛의 각도, 비에 젖은 노면, 갑자기 튀어나오는 동물 등 예상치 못한 '엣지 케이스(Edge Case, 특이 사례)'에 부딪히며 사고를 냈습니다. AI 에이전트의 안전 문제도 마찬가지입니다. 세상의 모든 잠재적 위험 시나리오를 128개로 압축할 수는 없습니다. 따라서 94.9%라는 숫자는 '이 기술이 가능성이 있다'는 신호탄으로 해석해야지, '문제가 해결되었다'는 보증수표로 여겨서는 곤란합니다.
재현되는가, 조건은 무엇인가. 이 질문을 항상 던져야 합니다. 다른 연구자들이 더 복잡하고 현실적인 벤치마크 환경에서 넥서스의 성능을 재현하고 검증하기 전까지, 우리는 흥분을 가라앉히고 신중한 태도를 유지해야 합니다.
4. 흔한 오해 두 가지 바로잡기
넥서스와 같은 AI 안전 기술을 둘러싸고 흔히 발생하는 오해 두 가지를 짚고 넘어가야 합니다.
오해 1: "넥서스 같은 안전장치가 있으면 AI 에이전트를 100% 믿고 맡길 수 있다."
이는 가장 위험한 착각입니다. 넥서스는 위험을 '관리'하는 도구이지, '제거'하는 마법 지팡이가 아닙니다. 94.9%의 성공률은 반대로 5.1%의 실패 가능성을 의미합니다. 만약 AI 에이전트가 1만 번의 행동을 한다면, 이론적으로 510번의 위험한 행동을 놓치거나 잘못 판단할 수 있다는 계산이 나옵니다. 단 한 번의 금융사고가 치명적인 결과를 낳을 수 있음을 감안하면, 이는 결코 무시할 수 없는 수치입니다. 자동차의 에어백이 모든 사고에서 우리를 완벽하게 지켜주지 못하는 것과 같은 이치입니다.
오해 2: "결국 AI를 통제하는 또 다른 AI일 뿐, 복잡하기만 하다."
넥서스의 접근법은 단순한 통제가 아닌 '협력적 교정'에 가깝다는 점을 이해해야 합니다. 아래 표에서 보듯, 기존 방식과 넥서스는 철학 자체가 다릅니다.
| 특성 | 기존 안전 필터 (단순 차단) | 넥서스 (구조화된 모니터) |
|---|---|---|
| 개입 방식 | 이분법적 (허용/차단) | 다단계적 (허용, 확인, 수정, 차단) |
| 판단 근거 | 정적 키워드, 단순 규칙 | 동적 맥락, 확률적 위험 점수, 계획 단위 분석 |
| 목표 | 위험 원천 차단 | 작업 성공률은 유지하되, 위험만 최소화 |
| 상호작용 | 일방적 통제 | 협력적 수정 유도 |
| 비유 | 출입 금지 푯말 | 관제탑 + 교통경찰 |
단순히 위험 행동을 막기만 하면 AI 에이전트의 효용성이 크게 떨어집니다. '수정 요청'이나 '확인 요청' 같은 중간 단계를 둠으로써, 넥서스는 AI 에이전트가 더 안전한 방식으로 임무를 완수하도록 돕습니다. 이는 AI의 자율성을 존중하면서도 안전을 확보하려는 중요한 시도입니다.
5. 진짜 전쟁터: '안전'은 누가 정의하는가?
기술의 한계를 넘어 우리가 마주할 더 근본적인 질문이 있습니다. 바로 '무엇이 위험한 행동인가?'라는 정의의 문제입니다.
예를 들어, AI 에이전트에게 '내 포트폴리오를 공격적으로 운영해줘'라고 지시했다고 가정해 봅시다. 어느 정도의 손실 위험까지가 '허용' 범위이고, 어디부터가 사용자 '확인'이 필요한 수준이며, 무엇이 무조건 '차단'해야 할 투기적 행동일까요? 이 기준은 사람마다, 상황마다 다릅니다. 누군가에게는 10%의 손실도 재앙이지만, 다른 누군가에게는 감수할 만한 위험일 수 있습니다.
결국 넥서스와 같은 안전 시스템의 규칙과 판단 기준은 누군가에 의해 설계되어야 합니다. 그 '누군가'는 AI 개발사일 수도, 정부 규제 기관일 수도, 혹은 사용자 자신일 수도 있습니다. 여기에 새로운 권력 문제가 발생합니다. 만약 AI 개발사가 자사 서비스에 유리하도록 '안전'의 기준을 설정한다면 어떻게 될까요? 예를 들어, 경쟁사 쇼핑몰에서의 구매는 '확인 요청'을 띄우면서 자사 쇼핑몰 구매는 '허용'하도록 만들 수 있습니다.
이는 개인의 '데이터 주권' 문제와 직결됩니다. 내 AI 비서의 행동 기준을 내가 정하지 못하고, 거대 기술 기업이 정해준 틀 안에서만 사용해야 한다면, 그 AI는 진정한 내 비서라고 할 수 있을까요? 아니면 기업의 이익을 위해 봉사하는 또 다른 형태의 감시관일까요? 앞으로 AI 에이전트의 '안전 설정' 권한을 누가 가질 것인지를 둘러싼 논쟁은, 과거 인터넷 초기의 '망 중립성' 논쟁만큼이나 중요한 사회적 의제가 될 것입니다.
6. 독자가 추적해야 할 세 가지 신호
넥서스는 AI 안전 기술의 중요한 진전이지만, 이제 막 첫걸음을 뗐을 뿐입니다. 앞으로 이 기술의 미래를 가늠하기 위해 다음 세 가지 신호를 꾸준히 추적해야 합니다.
- 벤치마크의 진화와 교차 검증: 넥서스의 연구 결과가 다른 연구팀에 의해, 더 현실적이고 복잡한 시나리오(예: 금융 사기, 소셜 엔지니어링 공격 등)가 포함된 벤치마크에서도 재현되는지 지켜봐야 합니다. 학계의 동료 평가(peer review)와 독립적인 검증이야말로 기술의 신뢰성을 담보하는 유일한 길입니다.
- 오픈소스화 여부: 넥서스와 같은 핵심 안전 기술이 특정 기업의 독점 기술(블랙박스)로 남는지, 아니면 누구나 코드를 들여다보고 검증하며 개선에 참여할 수 있는 오픈소스로 공개되는지는 매우 중요합니다. 투명성이 확보되지 않은 안전 기술은 그 자체로 또 다른 위험이 될 수 있습니다.
- 실제 적용 사례의 등장: 처음에는 위험도가 낮은 분야, 예를 들어 개인 일정 관리나 정보 요약 같은 작업에 먼저 적용될 것입니다. 이때 발생하는 실패 사례(failure case)와 그에 대한 기업의 대응 방식을 눈여겨봐야 합니다. 기술은 실패를 통해 성장하며, 그 과정을 투명하게 공개하고 개선하는 기업만이 장기적인 신뢰를 얻을 수 있습니다.
7. 독자가 던질 법한 질문들
마지막으로, 이 주제에 대해 독자들이 가질 법한 질문 세 가지에 답하며 글을 마무리하고자 합니다.
Q. 94.9%면 거의 완벽한 것 아닌가요? 왜 그렇게 신중해야 하나요?
A. 금융, 의료, 제어 시스템과 같이 실패의 대가가 매우 큰 '고위험' 영역에서는 99.999%의 신뢰도도 부족할 수 있습니다. 비행기 추락 확률이 0.1%라고 하면 누구도 그 비행기를 타려 하지 않을 것입니다. 또한, 앞서 강조했듯 94.9%는 실험실 수치입니다. 실제 환경에서는 성능이 더 낮아질 가능성이 높기 때문에, 이 숫자를 기준으로 섣부른 낙관을 하는 것은 금물입니다. 메커니즘과 예언을 구분해야 합니다. 이것은 가능성의 메커니즘을 보여준 것이지, 안전한 미래를 예언한 것이 아닙니다.
Q. 이런 안전장치가 있으면 AI 발전이 더뎌지는 것 아닌가요?
A. 오히려 그 반대일 수 있습니다. 자동차의 역사를 보면, 브레이크, 안전벨트, 에어백과 같은 안전장치가 있었기에 사람들은 더 빠르고 멀리 달릴 수 있었습니다. 신뢰할 수 있는 안전장치는 기술에 대한 사회적 수용성을 높이고, 규제가 엄격한 산업 분야로의 도입을 촉진하는 '가속 페달' 역할을 합니다. 안전은 발전의 발목을 잡는 족쇄가 아니라, 더 높은 단계로 나아가기 위한 필수적인 발판입니다.
Q. 개인이 이런 AI 에이전트를 쓸 때, '안전 설정'을 직접 할 수 있게 될까요?
A. 바로 그 지점이 앞으로 가장 중요한 싸움터가 될 것입니다. 이상적으로는 사용자가 자신의 위험 선호도에 맞춰 AI 에이전트의 행동 기준을 신용카드 한도를 설정하듯 자유롭게 조절할 수 있어야 합니다. 하지만 기업들은 법적 책임 문제나 사업 모델상의 이유로 제한된 선택지만을 제공하려 할 가능성이 높습니다. 사용자가 자신의 AI 에이전트에 대한 통제권, 즉 'AI 주권'을 얼마나 확보할 수 있는지가 미래 사회의 중요한 화두가 될 것입니다.
AI 에이전트라는 강력한 도구가 우리 손에 쥐어지고 있습니다. 넥서스는 그 도구에 안전장치를 달려는 의미 있는 시도입니다. 그러나 우리는 이 안전장치가 완벽하지 않다는 사실과, 그 안전장치의 열쇠를 누가 쥘 것인지에 대한 질문을 잊지 말아야 합니다. 기술의 발전을 환호하되, 그 그림자를 냉정하게 직시하는 자세가 그 어느 때보다 필요한 시점입니다.
이 브리핑이 유용했나요?
댓글 (0)
첫 댓글을 남겨주세요.