기술 트렌드
USA Today 발행사 Gannett, OpenAI에 2억 5천만 달러 소송 제기: AI 학습 데이터의 미래는?

인공지능(AI) 기술의 발전이 가속화될수록 그 이면에 자리한 저작권 논쟁은 더욱 뜨거워지고 있습니다. 최근 USA Today를 비롯한 수많은 지역 신문을 발행하는 미디어 그룹 Gannett이 OpenAI를 상대로 2억 5천만 달러(한화 약 3,450억 원) 이상의 손해배상을 청구하는 소송을 제기하며 이 논쟁의 중심에 섰습니다. Gannett은 OpenAI가 자사의 '수십만 개'에 달하는 기사들을 무단으로 AI 모델 학습에 사용했다고 주장하고 있습니다. 이는 뉴욕타임스(The New York Times)와 더 인터셉트(The Intercept) 등의 언론사, 그리고 다수의 작가들이 이미 OpenAI에 제기한 소송들과 맥을 같이하며, AI 시대 콘텐츠 저작권의 방향성을 가늠할 중대한 전환점이 될 전망입니다.
이번 소송의 핵심 쟁점은 명확합니다. Gannett은 자사의 뉴스 콘텐츠가 오랜 시간과 막대한 투자를 통해 생산된 저작물이며, 이러한 고품질 데이터를 OpenAI가 아무런 대가 없이 자사 AI 모델 학습에 활용하여 결과적으로 Gannett의 사업 모델을 위협하고 있다고 주장합니다. AI 모델이 학습 데이터를 기반으로 뉴스를 요약하거나 생성하는 기능은 결국 원본 기사로의 독자 유입을 감소시키고 광고 수익에 타격을 준다는 논리입니다. AI 기업들은 인공지능 모델 학습을 위한 데이터 사용이 미국 법의 '공정 이용(fair use)' 원칙에 해당한다고 항변해 왔습니다. 즉, AI가 원본 콘텐츠를 그대로 복제하는 것이 아니라 '변형적 이용(transformative use)'을 통해 새로운 결과물을 생성하므로 저작권 침해로 볼 수 없다는 입장입니다.
하지만 미디어 기업들의 반론도 만만치 않습니다. 인공지능이 생성한 결과물이 원본 콘텐츠와 너무 유사하거나, 원본의 시장 가치를 직접적으로 침해한다면 공정 이용으로 보기 어렵다는 것입니다. 특히 뉴스 콘텐츠의 경우, 시의성과 정확성이 중요한데 AI가 이를 요약, 전달하면서 원본 기사 트래픽을 빼앗아가는 문제가 발생한다는 지적입니다. 인공지능 전문가들은 LLM(대규모 언어 모델)의 고도화를 위해서는 방대한 양의 고품질 텍스트 데이터가 필수적이며, 뉴스 기사는 특히 정제되고 신뢰할 수 있는 정보를 제공한다는 점에서 AI 학습 데이터로서 가치가 높다고 평가합니다. 이런 배경 때문에 AI 개발사들은 그동안 뉴스 아카이브에 주목할 수밖에 없었습니다.
문제는 이러한 학습 데이터 확보 방식이 기존 콘텐츠 산업의 생태계를 파괴하고 있다는 점입니다. OpenAI와 같은 선두 AI 기업들은 막대한 자본과 기술력을 바탕으로 뉴스 기사들을 스크랩하여 모델을 훈련시켰지만, 이에 대한 정당한 대가 지불이나 라이선스 계약이 미비했다는 비판을 면하기 어렵습니다. 뉴욕타임스 소송에서 드러났듯이, AI 모델이 뉴욕타임스 기사를 거의 그대로 인용하거나 심지어 오보를 생성하는 사례는 공정 이용 주장의 설득력을 약화시킵니다. 이러한 상황은 결국 AI 학습 데이터의 출처 투명성 문제와도 직결됩니다.
AI 산업에 미칠 파장도 상당합니다. 만약 법원이 Gannett의 손을 들어준다면, AI 기업들은 향후 모델 학습을 위해 뉴스 콘텐츠를 포함한 모든 저작물에 대해 정당한 라이선스 계약을 체결해야 할 것입니다. 이는 AI 모델 개발 비용의 폭발적인 증가를 야기하고, 특히 중소 규모의 AI 스타트업들에게는 데이터 접근성을 심각하게 제한하는 요소로 작용할 수 있습니다. 반대로, AI 기업들이 승소할 경우, 콘텐츠 생산자들은 자신들의 저작물이 AI 학습에 무분별하게 활용되는 것을 막기 어려워지면서 새로운 비즈니스 모델을 찾아야 하는 압박에 직면할 것입니다. 일각에서는 AI 학습을 위한 콘텐츠 라이선스 시장이 새로 열릴 것이라는 전망도 나옵니다. 마치 Getty Images가 AI 기업들과 라이선스 계약을 체결했듯이, 새로운 저작권 관리 및 보상 시스템이 필요한 시점입니다.
이번 Gannett과 OpenAI의 소송은 단순히 한 기업과 AI 개발사 간의 다툼을 넘어, 인공지능 시대 콘텐츠 저작권의 새로운 판례를 만들고 AI 기술 개발의 윤리적, 상업적 방향성을 결정짓는 중요한 분수령이 될 것입니다. 저작권 보호와 AI 혁신이라는 두 가지 가치가 공존할 수 있는 합리적인 해법을 찾는 것이 이제 우리 모두의 숙제가 되었습니다.
인사이트
이번 Gannett의 소송은 단순한 저작권 분쟁을 넘어, 인공지능 시대에 콘텐츠의 가치와 창작자의 권리를 어떻게 보호하고 보상할 것인지에 대한 근본적인 질문을 던지며, AI 기술 개발의 방향성에도 중대한 영향을 미칠 것입니다.
자주 묻는 질문
- 왜 AI 회사들은 굳이 뉴스 기사를 학습시키나요?
- LLM의 최신 정보, 다양한 주제, 잘 정돈된 문장 구조가 AI 모델의 언어 이해력과 지식 기반을 확장하는 데 중요하기 때문입니다. 특히 뉴스 기사는 시의성과 신뢰성을 동시에 제공하여 AI의 답변 품질을 높이는 데 기여합니다.
- AI 학습에 사용된 콘텐츠에 대한 보상은 어떻게 이루어져야 할까요?
- 명확한 기준이 없으나, 현재 여러 모델이 논의 중입니다. 콘텐츠 제공에 따른 라이선스 비용 지불, AI가 생성한 콘텐츠의 수익 일부 공유, 또는 사용량에 따른 정액제 방식 등이 거론되고 있습니다.
- 만약 AI 회사들이 소송에서 패소하면 어떻게 될까요?
- AI 학습 데이터 확보에 막대한 비용 부담이 생겨 LLM 개발 속도가 늦춰지거나, 오픈소스 모델 개발이 위축될 수 있습니다. 또한, AI 학습을 위한 콘텐츠 라이선스 시장이 급성장하고, AI 모델이 학습 데이터를 명확히 명시해야 하는 의무가 부과될 가능성이 있습니다.
이 기사 어땠어요?
피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.