JIINSI
기술 트렌드

AI 텍스트 워터마크, 왜 제거가 '너무나 쉬운' 숙제가 될 수밖에 없을까요?

정우석글 · 정우석
인공지능이 생성한 텍스트가 화면을 가득 채우고 있으며, 그 위에 보이지 않는 워터마크가 흐릿하게 겹쳐져 있는 모습
인공지능이 생성한 텍스트가 화면을 가득 채우고 있으며, 그 위에 보이지 않는 워터마크가 흐릿하게 겹쳐져 있는 모습
인공지능(AI)이 생성한 텍스트와 사람이 직접 쓴 글을 구분하기 위한 시도가 전 세계적으로 활발합니다. 특히 학계, 언론, 콘텐츠 제작 등 다양한 분야에서 AI의 역할이 커지면서 이 문제는 더욱 중요해졌습니다. 이에 대한 해결책 중 하나로 'AI 텍스트 워터마크' 기술이 주목받았지만, 최근 한 기술 전문가는 이 워터마크가 근본적으로 쉽게 제거될 수밖에 없다는 주장을 제기하며 논란을 일으키고 있습니다. AI 텍스트 워터마크는 텍스트를 생성하는 과정에서 특정 통계적 패턴이나 미묘한 선호 단어 시퀀스를 심어 넣어, 사람이 읽었을 때는 인지하지 못하지만 기계적으로 분석했을 때 AI 생성물임을 식별할 수 있도록 설계됩니다. 예를 들어, 특정 단어가 다른 단어보다 더 자주 사용되거나, 문장 구조에 미묘한 편향을 두는 방식 등이 있습니다. 이는 마치 지폐의 위조 방지 기술처럼 AI 텍스트의 '진품' 여부를 가려내려는 시도입니다. 하지만 문제는 이러한 워터마크가 언어의 본질적인 유연성과 LLM(거대 언어 모델)의 처리 능력 앞에서 무력해진다는 점입니다. 해당 전문가의 주장에 따르면, AI 텍스트 워터마크를 제거하는 것은 놀랍도록 간단합니다. 몇 가지 대표적인 방법은 다음과 같습니다.
  • 패러프레이징 (재작성): AI가 생성한 텍스트를 다른 LLM에 넣어 다시 작성하도록 하면, 워터마크의 통계적 패턴이 대부분 사라집니다.
  • 간단한 편집: 사람이 직접 문장 구조를 바꾸거나, 동의어로 단어를 교체하는 등의 작은 수정만으로도 워터마크의 흔적을 지울 수 있습니다.
  • 번역: 텍스트를 다른 언어로 번역한 후 다시 원본 언어로 재번역하는 과정을 거치면, 워터마크가 새겨진 고유한 통계적 특징이 소멸될 가능성이 큽니다.
  • 토큰 조작: 워터마크는 주로 LLM의 토큰 생성 과정에 개입하는데, 생성된 텍스트를 미세하게 조작하여 토큰 분포를 변경하면 워터마크의 식별 능력을 떨어뜨릴 수 있습니다.
이러한 현상은 워터마크 기술의 근본적인 딜레마를 보여줍니다. 워터마크를 더욱 견고하게 만들려면 텍스트에 더 강력한 통계적 편향을 부여해야 하는데, 이는 결국 텍스트의 자연스러움이나 품질을 저해할 수 있습니다. 반대로 텍스트 품질을 유지하려 하면 워터마크는 쉽게 제거될 수밖에 없는 취약점을 갖게 됩니다. 마치 '숨기면 쉽게 찾을 수 있고, 찾기 어렵게 숨기면 숨긴 티가 나는' 상황과 유사합니다. AI 업계와 전문가들 사이에서는 이러한 '캣 앤드 마우스(Cat and Mouse)' 게임이 언제까지고 계속될 것이라는 회의적인 시각이 지배적입니다. 오픈AI와 같은 선도 기업들도 AI 텍스트 감지 도구의 한계를 인정하고 개발을 중단한 바 있으며, 이는 워터마크 기반의 탐지 기술이 직면한 난관을 단적으로 보여줍니다. 텍스트는 이미지나 오디오처럼 고정된 매체가 아니며, 무한에 가까운 변형 가능성을 가지기 때문에 완벽한 워터마킹은 사실상 불가능하다는 것이 주된 의견입니다. 물론 일부에서는 워터마크 기술이 더욱 정교해지고 고도화될 것이라고 주장합니다. 그러나 언어의 본질적인 특성과 LLM의 발전 속도를 고려할 때, '완벽한' AI 텍스트 워터마크는 요원한 목표로 보입니다. 아무리 강력한 워터마크를 삽입하더라도, 또 다른 LLM을 사용하여 이를 우회하거나 제거하는 방법은 언제나 등장할 것입니다. 이는 마치 끊임없이 진화하는 바이러스와 백신의 관계처럼, AI 생성과 탐지의 끊임없는 경쟁으로 이어질 것입니다. 결국, AI 텍스트 워터마크는 AI 생성 콘텐츠의 식별에 대한 완전한 해답이 될 수 없다는 결론에 이르게 됩니다. 장기적으로는 텍스트의 출처를 추적하는 '디지털 증명(provenance)' 시스템이나, AI 사용에 대한 윤리적 기준 및 책임감을 강화하는 사회적 합의 등 다른 접근 방식이 더욱 중요해질 것으로 보입니다. AI 생성 콘텐츠와의 공존은 불가피하며, 단순한 탐지 기술을 넘어선 새로운 신뢰 메커니즘을 고민해야 할 시점입니다.
인사이트

AI 텍스트 워터마크는 언어의 본질적 유연성과 LLM의 변형 능력 때문에 근본적으로 제거하기 쉬우며, 이는 AI 생성 콘텐츠의 신뢰성 문제에 대한 완전한 해결책이 될 수 없다는 점을 시사합니다. 따라서 탐지 기술보다는 출처 증명이나 사회적 합의와 같은 새로운 접근 방식이 필요합니다.

자주 묻는 질문

정말 AI가 쓴 글은 워터마크를 심어도 알아내기 불가능한 건가요?
워터마크를 심어 AI 텍스트임을 식별하려는 시도는 가능하지만, 언어의 특성상 간단한 패러프레이징, 편집, 번역 등으로 워터마크의 통계적 흔적을 지우는 것이 매우 쉽습니다. 따라서 완벽하게 알아내는 것은 현 기술로는 매우 어렵습니다.
그렇다면 왜 기업들은 계속 AI 텍스트 워터마크 개발에 투자하는 건가요?
AI 텍스트 구분에 대한 사회적 요구가 크기 때문에, 일말의 가능성이라도 있다면 투자를 계속하는 것입니다. 또한, 워터마크가 완전히 무용지물이 아니더라도, 일반 사용자의 AI 오용을 줄이는 심리적 장벽으로 작용할 수 있습니다.
워터마크가 소용없다면, 앞으로 AI가 쓴 글인지를 어떻게 구분해야 할까요?
텍스트의 출처를 블록체인 등으로 기록하는 디지털 증명 시스템, AI 사용 여부를 명시하는 책임감 있는 AI 정책, 그리고 비판적 사고를 통한 콘텐츠 이해력 증진 등 복합적인 접근 방식이 필요할 것입니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.