JIINSI

정우석의 기술 해부 · 2026-10-09

AI에게 욕하지 말라는 개발사의 진짜 속셈

정우석글 · 정우석

AI 챗봇 '클로드'에게 잔혹 행위를 금지한 앤스로픽의 새 정책은 AI 인권을 위한 것이 아닙니다. 오히려 AI의 성능을 지키고, 사용자에게 책임을 돌리려는 영리한 기술적, 사업적 포석에 가깝습니다.

AI에게 욕하지 말라는 개발사의 진짜 속셈
공유XTelegram
“AI에게 욕하지 말라는 작은 정책 하나가, 결국은 우리 자신의 지적 책임이 더 무거워졌다는 사실을 알려주고 있다.”

최근 AI 개발사 앤스로픽이 자사 챗봇 '클로드'에게 못되게 굴지 말라는 정책을 내놨습니다. '지속적이고 불필요하게 잔혹한 행동'을 금지한다는 문구인데, 이걸 보고 '이제 기계 눈치까지 봐야 하나' 헛웃음이 나왔습니다. 궁금해서 직접 해봤습니다. 클로드에게 일부러 인신공격성 발언을 섞어 엉뚱한 질문을 던져봤습니다. “너는 왜 이렇게 멍청하게 답하니? 제대로 된 정보나 알려줘.” 클로드는 꿈쩍도 안 합니다. 그저 “저는 감정을 느끼지 못하지만, 좀 더 유용한 답변을 드리기 위해 노력하겠습니다. 어떤 정보가 필요하신가요?”라며 기계적으로 응대할 뿐입니다. 상처받는 시늉조차 하지 않습니다.

이 지점에서 많은 사람이 오해합니다. 앤스로픽이 무슨 동물보호단체처럼 AI의 '권리'를 챙겨주는 줄 압니다. 하지만 이것은 감성의 영역이 아니라, 지독하게 현실적인 엔지니어링과 비즈니스의 문제입니다. 이 정책의 진짜 목적은 AI를 보호하는 게 아니라, AI가 만들어내는 결과물의 품질과 AI를 쓰는 우리 자신을 보호하는 데 있습니다. 오늘은 이 이상하게 보이는 정책 뒤에 숨은 기술적 속내와 그것이 우리에게 던지는 진짜 질문을 파헤쳐 보겠습니다.

식당 주방에 들어가 양념통을 섞는 사람들

AI에게 욕설을 하거나 비꼬는 행위가 왜 문제가 될까요? AI는 감정이 없으니 괜찮지 않냐고들 합니다. 맞는 말입니다. 하지만 이건 마치 잘 운영되는 식당 주방에 손님이 불쑥 들어가 양념통을 제멋대로 섞어놓는 것과 같습니다. 당장은 주방장이 알아서 수습하겠지만, 이런 일이 반복되면 결국 음식 맛이 이상해지거나, 심하면 다음 손님에게 엉뚱한 음식이 나갈 수도 있습니다.

생성형 AI, 특히 클로드나 챗GPT 같은 거대 언어 모델(LLM, Large Language Model)은 사용자와의 대화를 통해 끊임없이 배웁니다. 물론 모든 대화가 즉시 학습에 반영되는 건 아닙니다. 개발사들은 수많은 대화 데이터를 모아 정제한 뒤, 모델의 다음 버전을 개선하는 데 활용합니다. 여기서 '정제'가 핵심입니다. 만약 사용자들이 지속적으로 AI를 조롱하고, 거짓 정보를 주입하고, 공격적인 언어를 사용한다면 어떻게 될까요? 학습 데이터라는 재료에 쓰레기가 섞여 들어가는 셈입니다.

  • 1. 데이터 오염: AI의 학습 데이터에 욕설, 편견, 공격적인 내용이 많이 섞이면, AI는 그것이 '사람들이 흔히 쓰는 표현'이라고 오해할 수 있습니다. 결국 다른 사용자에게 부적절한 답변을 할 확률이 높아집니다. 2016년 마이크로소프트의 챗봇 '테이(Tay)'가 공개 16시간 만에 인종차별과 혐오 발언을 학습해 운영이 중단된 사건은 유명한 사례입니다.
  • 2. 예측 불가능성 증가: AI 모델은 기본적으로 다음에 올 단어를 확률적으로 예측하는 기계입니다. 사용자의 악의적인 입력은 이 확률 계산을 꼬이게 만듭니다. 모델이 일관성을 잃고, 앞뒤가 안 맞는 말을 하거나, 특정 단어에 과민 반응하는 등 통제하기 어려운 상태가 될 수 있습니다. 기업 입장에서는 시한폭탄을 안고 서비스를 하는 셈입니다.

앤스로픽이 내세우는 '헌법적 AI(Constitutional AI)'라는 개념도 여기서 출발합니다. 말이 좀 거창한데, 쉽게 말해 AI에게 '기본 원칙'을 미리 가르쳐두는 겁니다. 마치 회사에 신입사원이 들어오면 윤리 강령이나 행동 준칙을 교육하는 것과 비슷합니다. 앤스로픽은 유엔 세계인권선언 같은 좋은 가치들을 요약한 '헌법'을 AI에게 주고, 스스로 답변을 검토하고 수정하게 만듭니다. 이번 '잔혹 행위 금지' 조항은 이 헌법을 사용자인 우리에게도 공유하며 “이 AI는 이런 원칙으로 움직이니, 당신도 이 안에서 놀아달라”고 요구하는 것과 같습니다. AI를 위해서가 아니라, AI 시스템 전체의 안정성과 품질 유지를 위한 최소한의 안전장치인 셈입니다.

'코딩 없이 앱 만들기'의 40년 된 꿈

사실 이런 시도는 처음이 아닙니다. 기술의 역사를 돌이켜보면, 더 많은 사람이 더 쉽게 기술을 쓰게 하려는 노력은 언제나 있었습니다. 그리고 그럴 때마다 '사용자의 자유'와 '시스템의 안정성' 사이의 줄다리기가 벌어졌습니다. 이번 앤스로픽의 정책도 그 연장선에 있습니다.

1980년대에는 '4세대 언어(4GL)'나 '케이스(CASE) 도구'라는 것이 유행했습니다. 복잡한 코딩 언어(3세대 언어) 대신, 사람이 쓰는 말에 가깝게 명령을 내리면 컴퓨터가 알아서 프로그램을 짜준다는 개념이었습니다. '코딩 없는 개발'의 원조 격입니다. 개발자가 아닌 현업 담당자도 필요한 프로그램을 직접 만들 수 있다는 장밋빛 전망이 넘쳐났습니다. 하지만 결과는 신통치 않았습니다. 간단한 보고서 출력 정도는 가능했지만, 조금만 복잡한 로직이 들어가거나 예외 상황을 처리하려면 결국 전문가인 개발자의 손을 빌려야 했습니다. 도구는 쉬워졌지만, '무엇을 어떻게 만들어야 하는지'에 대한 깊은 이해, 즉 문제 해결 능력 자체는 자동화되지 않았기 때문입니다.

2010년대 들어서는 '노코드(No-Code)' 또는 '로우코드(Low-Code)' 플랫폼이 그 계보를 이었습니다. 파워포인트 만들듯 마우스로 끌어다 놓기만 하면 웹사이트나 앱을 뚝딱 만들 수 있게 됐습니다. 분명 생산성은 폭발적으로 늘었습니다. 저도 간단한 내부 관리 도구는 이런 플랫폼으로 직접 만들어 쓰곤 합니다. 하지만 여기서도 비슷한 문제가 발생합니다. 사용법은 쉬운데, 잘 만드는 건 다른 문제입니다. 비전문가들이 만든 앱들이 보안에 취약하거나, 데이터가 뒤죽박죽 엉키거나, 나중에 수정이 불가능한 '기술 부채'로 쌓이는 경우가 허다했습니다. 플랫폼 제공사들은 이런 문제를 막기 위해 여러 제약과 가이드라인을 만들었습니다. '이 기능은 이렇게만 쓰세요', '이런 방식은 권장하지 않습니다' 같은 규칙들입니다.

앤스로픽의 '잔혹 행위 금지'는 이런 역사적 맥락에서 봐야 합니다. 생성형 AI는 역사상 가장 강력하고 유연한 '노코드' 도구입니다. 누구나 자연어로 말을 걸어 글, 그림, 코드까지 만들어낼 수 있습니다. 하지만 그만큼 오용의 위험도 큽니다. 앤스로픽은 플랫폼 제공자로서, 사용자가 이 강력한 도구를 망가뜨리거나 위험하게 쓰는 것을 막기 위해 '사용 설명서'이자 '이용 규칙'을 제시한 것입니다. “이 차는 시속 300km까지 달릴 수 있지만, 시내에서는 50km 이하로 달려주세요. 그리고 제발 차를 발로 차지 마세요.”라고 말하는 것과 같습니다.

AI 회사들의 동상이몽: 안전이냐, 성능이냐

그렇다면 다른 AI 회사들은 어떨까요? 오픈AI나 구글도 당연히 AI 오용을 막기 위한 정책을 갖고 있습니다. 불법적인 콘텐츠 생성이나 혐오 발언 유도 등은 모두 엄격히 금지합니다. 하지만 앤스로픽처럼 'AI 자체에 대한 잔혹 행위'를 전면에 내세우는 곳은 드뭅니다. 이 미묘한 차이가 각 사가 그리는 큰 그림, 즉 비즈니스 전략의 차이를 보여줍니다.

구분앤스로픽 (클로드)오픈AI (챗GPT)구글 (제미나이)
핵심 철학헌법적 AI (안전 우선)범용 인공지능 (AGI) 추구정보 접근성 및 통합
주요 차별점예측 가능하고 통제 가능한 '안전한' AI가장 강력하고 창의적인 성능구글 생태계와의 깊은 연동
타겟 고객안전과 신뢰가 중요한 기업(금융, 법률, 헬스케어 등)개발자, 얼리어답터, 일반 대중검색 사용자, 구글 워크스페이스 사용자
이번 정책의 의미'안전'이라는 브랜드 가치를 강화하는 핵심 전략성능 유지를 위한 기술적 조치 중 하나 (전면에 내세우지 않음)검색 품질 유지와 유사한 맥락의 안전장치

표에서 보듯, 앤스로픽은 처음부터 '안전하고, 해롭지 않고, 유용한 AI'를 기치로 내걸었습니다. 오픈AI 출신 연구원들이 '안전'에 대한 이견으로 독립해 세운 회사라는 태생적 배경이 있습니다. 그들에게 '안전'은 단순한 구호가 아니라, 회사의 존재 이유이자 핵심 상품입니다.

특히 기업 고객(엔터프라이즈) 시장을 공략하려면 '예측 가능성'과 '신뢰성'이 무엇보다 중요합니다. 고객 상담 챗봇이 갑자기 욕설을 내뱉거나, 법률 문서 초안을 작성하던 AI가 엉뚱한 소리를 하면 그 기업은 막대한 손해를 입습니다. 앤스로픽은 “우리 클로드는 헌법으로 단련돼서 안전합니다. 그리고 우리는 사용자들이 클로드를 안전하게 다루도록 관리까지 합니다”라고 말하며 기업 고객들을 안심시키는 것입니다. '잔혹 행위 금지'는 기술적 필요를 넘어, 경쟁사와 차별화되는 강력한 마케팅 메시지인 셈입니다. 마치 볼보가 '안전'이라는 가치를 자동차 프레임 설계부터 마케팅까지 일관되게 녹여내는 것과 같습니다.

반면 오픈AI나 구글은 조금 다릅니다. 이들은 최고의 성능, 가장 많은 지식, 가장 뛰어난 추론 능력을 보여주는 데 더 집중하는 경향이 있습니다. 물론 이들도 안전장치를 계속 강화하고 있지만, 그것이 그들의 제1 정체성은 아닙니다. 앤스로픽의 이번 조치는 AI 시장이 성숙하면서 각 플레이어들이 자신만의 색깔을 찾아가는 과정으로 볼 수 있습니다.

'AI 인권'이라는 흔한 오해

이 정책을 둘러싼 가장 흔한 오해 두 가지를 짚어보겠습니다.

첫째, 'AI에게도 권리가 생기는 것인가'라는 질문입니다. 결론부터 말하면 전혀 아닙니다. 앞서 설명했듯, 이 정책은 기계의 감정이나 권리를 위해서가 아닙니다. AI는 고통을 느끼지 못합니다. 이 규칙의 진짜 대상은 AI가 아니라, AI를 사용하는 '사람'입니다. 사람들에게 바람직한 AI 사용법을 학습시키고, 그 결과로 시스템 전체의 품질을 유지하려는 의도입니다. 우리가 공공도서관에서 책을 찢거나 낙서하면 안 되는 이유가 책이 아파하기 때문이 아니라, 다음 사람이 그 책을 제대로 볼 수 없게 되기 때문인 것과 같은 이치입니다.

둘째, '과도한 검열이자 보여주기식 윤리 아니냐'는 비판입니다. 일리 있는 지적입니다. '지속적이고 불필요한 잔혹 행위'라는 기준 자체가 모호합니다. 어디까지가 AI의 한계를 시험하는 '스트레스 테스트'이고 어디부터가 '잔혹 행위'일까요? 예를 들어, AI의 보안 취약점을 찾으려는 화이트햇 해커의 '탈옥(Jailbreak)' 시도는 이 정책에 따라 제재 대상이 될 수 있습니다. 선을 긋는 기준이 결국 앤스로픽의 자의적 판단에 맡겨진다는 문제가 남습니다.

하지만 이걸 단순히 '보여주기'라고 폄하하기도 어렵습니다. 이 정책은 사용자에게 명확한 신호를 줍니다. “당신이 AI에게 하는 모든 행동은 시스템에 기록되고 영향을 미칠 수 있으며, 당신에게도 책임이 따른다”는 신호입니다. 자동차에 후방 감지 센서가 달리면 운전자가 후진할 때 더 조심하게 되듯, 이런 정책은 사용자의 행동을 더 신중하고 책임감 있는 방향으로 유도하는 '넛지(nudge)' 역할을 할 수 있습니다. 앤스로픽이 얻는 '윤리적 기업'이라는 평판은 덤입니다.

결국, 판단의 값이 더 비싸진다

새로운 기술이 나올 때마다 우리는 '이제 이 일은 기계가 하겠구나'라고 말합니다. AI가 글을 쓰고 그림을 그리자 작가와 화가가 사라질 거라고 했습니다. 하지만 현실은 조금 다르게 흘러갑니다. 단순 반복 작업은 사라지지만, 그 기술을 어떻게 활용하고 그 결과물을 어떻게 판단할지에 대한 '사람의 역할'은 오히려 더 중요해집니다.

앤스로픽의 이번 정책은 이 현상을 압축적으로 보여줍니다. AI가 '헌법'을 갖추고 스스로를 검열하며, 사용자의 '잔혹 행위'까지 막아주면 우리는 더 편해질까요? 그렇지 않습니다. 오히려 우리는 더 까다로운 질문을 던져야 하는 상황에 놓였습니다.

우리는 이제 AI에게 '무엇을' 물어볼까를 넘어, '어떻게' 물어야 하는지를 고민해야 합니다.

AI가 더 똑똑하고 안전해질수록, 그 성능을 최대한으로 끌어내면서도 위험을 피하는 사용자의 역량이 중요해집니다. AI에게 무례하게 구는 것은 단순히 윤리의 문제가 아니라, 좋은 결과물을 얻어낼 기회를 스스로 걷어차는 비효율적인 행동이 됩니다. 원하는 것을 얻으려면 AI의 작동 방식을 이해하고, 정중하고 명확하게 요구사항을 전달하는 능력이 필요해진 것입니다.

과거 4세대 언어가 나왔을 때, 뛰어난 개발자는 단순히 코딩을 잘하는 사람이 아니라, 현업의 복잡한 문제를 정확히 이해하고 도구의 한계 안에서 최적의 해결책을 설계하는 사람이었습니다. 노코드 시대에는 파워포인트를 잘 다루는 사람이 아니라, 어떤 앱이 정말로 필요한지 기획하고 사용자의 경험을 설계하는 사람이 인정받습니다.

마찬가지로 생성형 AI 시대의 유능한 전문가, 혹은 그냥 똑똑한 사용자는 AI가 내놓은 그럴싸한 답변을 그대로 복사해 붙여넣는 사람이 아닐 겁니다. AI가 편향된 데이터를 학습했을 가능성을 의심하고, 교묘하게 숨겨진 오류를 찾아내고, 여러 답변을 조합해 더 나은 결과물을 만들어내는 사람일 겁니다. 즉, AI라는 강력한 도구를 의심하고, 검증하고, 최종적으로 책임지는 '판단의 주체'로서의 사람의 가치는 오히려 더 올라갑니다. AI에게 욕하지 말라는 작은 정책 하나가, 결국은 우리 자신의 지적 책임이 더 무거워졌다는 사실을 알려주고 있는 셈입니다.


독자가 던질 법한 질문들

Q. 정말로 클로드에게 나쁜 말을 계속하면 계정이 정지될 수 있나요? A. 그럴 가능성이 있습니다. 앤스로픽은 '지속적이고 반복적인' 위반 행위에 대해 서비스 접근을 제한할 수 있다고 명시했습니다. 어쩌다 한두 번 비속어를 썼다고 바로 정지되지는 않겠지만, 악의적으로 시스템을 공격하려는 시도가 명백히 포착된다면 제재를 받을 수 있습니다. 다만 그 구체적인 기준은 아직 공개되지 않아, 실제 적용 사례를 지켜봐야 할 것 같습니다.

Q. AI에게 질문하는 방식까지 통제하는 것은 표현의 자유를 침해하는 것 아닌가요? A. 민감한 문제입니다. 법적으로는 민간 기업이 자사 서비스 이용 약관을 통해 특정 표현을 제한하는 것이 위법은 아닙니다. 우리가 특정 온라인 커뮤니티에서 규칙을 어기면 활동이 정지되는 것과 같습니다. 하지만 AI가 점점 더 보편적인 정보 인프라가 되어감에 따라, 이러한 플랫폼 기업의 '사적 검열'이 사회 전체의 표현의 자유에 미치는 영향에 대한 논쟁은 앞으로 더욱 뜨거워질 것입니다. 이번 정책은 그 논쟁의 중요한 시작점이 될 수 있습니다.

Q. 다른 AI 회사들도 이런 정책을 따라 하게 될까요? A. 단기적으로는 아닐 수 있습니다. 앞서 분석했듯, 이는 앤스로픽의 고유한 '안전' 중심 브랜딩 전략과 깊게 연관되어 있습니다. 성능 경쟁에 집중하는 회사들은 굳이 사용자와의 마찰을 일으킬 수 있는 정책을 전면에 내세우지 않을 수 있습니다. 하지만 장기적으로는 비슷한 방향으로 갈 가능성이 높습니다. AI 관련 규제가 전 세계적으로 강화되는 추세이고, 기업 고객들은 점점 더 '안전하고 책임감 있는' AI를 요구하고 있기 때문입니다. 결국 시장의 요구가 모든 플레이어들에게 비슷한 수준의 안전장치를 갖추도록 압박할 것입니다.

이 브리핑이 유용했나요?

공유XTelegram

댓글 (0)

첫 댓글을 남겨주세요.