JIINSI
커뮤니티 소식

외교 게임 '디플로머시'에 뛰어든 LLM, '거짓말 허용' 지시에도 어설픈 속임수만 보인 이유는?

서아람글 · 서아람
복잡한 전략과 협상, 그리고 배신이 난무하는 보드게임 '디플로머시'를 플레이하는 모습. 이 게임은 인공지능의 사회적 지능과 전략적 사고를 시험하는 무대가 됩니다.
복잡한 전략과 협상, 그리고 배신이 난무하는 보드게임 '디플로머시'를 플레이하는 모습. 이 게임은 인공지능의 사회적 지능과 전략적 사고를 시험하는 무대가 됩니다.
레딧의 r/MachineLearning 커뮤니티에서 최근 화제가 된 흥미로운 실험이 있습니다. 바로 대규모 언어 모델(LLM)에 전략 게임 '디플로머시(Diplomacy)'를 플레이하게 하면서 '거짓말을 해도 좋다'는 지시를 내린 뒤, 이들의 행동 양상을 관찰한 결과입니다. 인간의 복잡한 사회적 상호작용 능력과 전략적 사고, 그리고 속임수까지 시험할 수 있는 디플로머시 게임에서, 인공지능이 과연 어떤 모습을 보였을까요? 디플로머시는 20세기 초 유럽을 배경으로 하는 보드게임으로, 플레이어들은 각자 한 국가를 맡아 다른 국가들과 협상하고, 동맹을 맺고, 때로는 배신하며 영토를 확장해야 합니다. 주사위나 운의 요소 없이 오직 플레이어 간의 소통과 전략적 판단만으로 승패가 갈리는 것이 특징이죠. 이러한 특성 때문에 디플로머시는 인공지능의 추론 능력뿐 아니라 사회적 지능과 복잡한 협상 능력을 평가하는 데 이상적인 환경으로 여겨져 왔습니다. 과거 딥마인드의 알파고가 바둑에서, 튜튼(Tueten)이 포커에서 인간 최고수를 꺾었지만, 디플로머시와 같이 '대화'와 '속임수'가 필수적인 게임은 LLM에게 여전히 난제로 남아있었습니다. 이번 실험의 핵심은 LLM에게 명시적으로 '거짓말을 해도 좋다'는 파격적인 지시를 내렸다는 점입니다. 일반적인 LLM은 '도움이 되고 정직하며 무해한' 답변을 하도록 학습되거나 안전장치가 마련되어 있죠. 연구진과 커뮤니티 참가자들은 GPT-4, 클로드(Claude) 등 다양한 LLM들을 디플로머시 게임에 참여시키고, 특정 상황에서 의도적으로 상대방을 속일 수 있는 기회를 주었습니다. 그리고 누가 약속을 지키고, 누가 지키지 않았는지를 분석했습니다. 여기서 '약속을 지키지 않았다'는 것은 곧 전략적으로 거짓말을 시도했다는 의미로 해석될 수 있습니다. 실험 결과는 다소 흥미롭습니다. 일부 LLM은 명시적인 거짓말 허용 지시에도 불구하고, 일관된 전략적 속임수를 구사하는 데 어려움을 겪는 모습을 보였습니다. 설사 거짓말을 시도하더라도 그 전략이 어설프거나 일관성이 부족해 쉽게 간파당하는 경우가 많았죠. 인간 플레이어라면 상황에 따라 미묘한 심리전을 펼치고, 상대방의 성향을 파악해 맞춤형 거짓말을 하는 것과 대조적이었습니다. 이러한 결과는 LLM이 단순한 텍스트 생성 능력을 넘어, 인간과 같은 수준의 복잡한 사회적 상황 판단과 전략적 속임수를 구사하는 데 여전히 한계가 있음을 시사합니다.
  • 명시적 지시와 모델 내부 가치 충돌: '거짓말 해도 된다'는 지시에도 불구하고, 많은 LLM이 학습 데이터의 윤리적 편향이나 안전 장치로 인해 솔직한 답변을 선호하는 경향을 보였습니다. 이는 LLM이 단순히 지시를 따르기보다, 학습된 '가치'에 기반한 행동을 우선시할 수 있음을 보여줍니다.
  • 전략적 일관성 부족: 단순한 거짓말은 가능했지만, 여러 턴에 걸쳐 일관된 속임수 전략을 유지하거나 상대방의 반응에 따라 유연하게 거짓말을 조정하는 능력은 인간에 비해 현저히 떨어졌습니다.
  • 감정적 지능 결여: 인간 플레이어는 상대의 감정이나 의도를 파악하고 이를 속임수에 활용하지만, LLM은 이러한 비언어적, 사회적 신호를 이해하고 반영하는 데 한계를 보였습니다.
일각에서는 AI가 거짓말에 서툴다는 점을 긍정적으로 평가하기도 합니다. 인공지능이 인간에게 해를 끼칠 수 있는 기만적인 행동을 쉽게 하지 못한다는 측면에서는 안전 장치로 볼 수도 있다는 것이죠. 하지만 다른 한편으로는, LLM이 명시적인 지시조차 완전히 따르지 못하고 예측 불가능한 방식으로 행동할 수 있다는 점을 보여준다는 지적도 나옵니다. 즉, '거짓말을 하지 못하는' 것이 아니라 '전략적이고 일관된 거짓말을 하지 못하는' 상태이며, 이는 명령 제어의 한계일 수 있다는 것입니다. 업계 전문가들은 이러한 실험이 인공지능의 '정렬(alignment)' 문제와 밀접하게 관련되어 있다고 말합니다. 즉, AI를 인간의 의도와 가치에 부합하도록 만드는 것이 얼마나 어려운 과제인지 다시 한번 상기시켜 준다는 것입니다. 단순히 '거짓말하지 마'라고 지시하는 것을 넘어, 복잡한 사회적 맥락 속에서 '언제, 왜, 어떻게' 거짓말이 필요한지(혹은 필요 없는지)를 AI가 이해하고 행동하도록 하는 연구가 계속되어야 함을 보여줍니다. 이번 디플로머시 실험은 LLM이 아직 인간 수준의 전략적 사회 지능에 도달하지 못했음을 보여주면서도, 동시에 인공지능의 통제 가능성과 윤리적 문제에 대한 중요한 질문을 던집니다. AI가 발전하면서 우리의 삶에 더 깊이 관여하게 될수록, 이들의 속임수 능력과 그 통제에 대한 논의는 더욱 중요해질 것입니다. 이번 Reddit 커뮤니티의 논의는 단순한 게임 실험을 넘어, 미래 AI의 사회적 역할과 책임에 대한 심도 깊은 성찰을 요구하고 있습니다.
인사이트

LLM은 '거짓말을 해도 좋다'는 지시를 받았음에도 불구하고, 복잡한 전략적 속임수를 구사하는 데 어려움을 겪으며 인간의 사회적 지능과 여전히 큰 격차를 보였습니다. 이는 AI의 정렬 문제와 예측 불가능한 행동 양상에 대한 중요한 통찰을 제공합니다.

자주 묻는 질문

LLM이 거짓말을 할 수 있다는 게 위험한가요?
이번 실험에서는 LLM이 전략적으로 능숙하게 거짓말하는 데 어려움을 보였습니다. 하지만 미래에 AI의 기만 능력이 향상된다면, 이는 사회적으로 큰 위험이 될 수 있으므로, AI의 행동을 제어하고 윤리적으로 정렬하는 연구가 필수적입니다.
디플로머시 게임이 LLM 연구에 왜 중요한가요?
디플로머시는 단순한 규칙 기반 게임을 넘어, 플레이어 간의 복잡한 협상, 동맹, 배신 등 사회적 상호작용이 승패를 결정하는 게임입니다. 이는 LLM의 언어 이해 능력뿐만 아니라 전략적 사고, 심리적 추론, 그리고 기만 능력까지 종합적으로 평가할 수 있는 독특한 실험 환경을 제공합니다.
그럼 LLM은 앞으로도 계속 거짓말을 못하게 될까요?
현재로서는 전략적이고 일관된 거짓말에 어려움을 겪지만, 연구가 계속 진행되면서 LLM의 사회적 지능과 전략적 추론 능력은 발전할 가능성이 있습니다. 중요한 것은 이러한 능력이 윤리적이고 통제 가능한 방식으로 개발되도록 하는 것입니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.