JIINSI
기술 트렌드

마이크로소프트 임원, AI 학습 데이터 스크래핑을 '역사상 최대 노동력 절도'로 규정하며 파문

정우석글 · 정우석
오픈AI와 마이크로소프트가 뉴욕 타임스와의 저작권 소송에 휘말린 가운데, AI 학습 데이터 사용에 대한 논의가 뜨거워지고 있는 법원 앞 모습.
오픈AI와 마이크로소프트가 뉴욕 타임스와의 저작권 소송에 휘말린 가운데, AI 학습 데이터 사용에 대한 논의가 뜨거워지고 있는 법원 앞 모습.
최근 마이크로소프트의 고위 임원이 AI 모델 학습을 위한 데이터 스크래핑을 "인류 역사상 최대의 노동력 절도"라고 비판한 사실이 알려지며 인공지능 산업 전반에 큰 파문이 일고 있습니다. 이 발언은 뉴욕 타임스(The New York Times, NYT)가 오픈AI와 마이크로소프트를 상대로 제기한 저작권 침해 소송에서 공개된 법률 문서에 포함되어 더욱 주목받고 있습니다. AI 기술의 발전 속도가 가속화될수록 저작권 침해와 공정 사용의 경계에 대한 논란은 더욱 격화될 것으로 보입니다. 해당 발언의 주인공은 마이크로소프트의 기계 학습 이사인 스튜어트 러셀(Stuart Russell)입니다. 그는 법원 제출 문서에서 AI 시스템이 학습 데이터로 사용하는 웹 콘텐츠 스크래핑 관행을 두고 강력한 비판의 목소리를 냈습니다. 러셀 이사는 이 행위를 콘텐츠 창작자들의 정당한 노동 가치를 침해하는 것으로 간주합니다. 같은 문서에서는 오픈AI의 특별 프로젝트 책임자인 토마스 루벤(Thomas Reuben) 역시 내부 이메일에서 챗GPT(ChatGPT)가 "출판사들에게 실존적인 위협이 될 수 있다"고 인정한 사실도 드러나, 업계 거물들의 내부적 우려가 수면 위로 떠올랐습니다. 논란의 핵심은 NYT가 오픈AI와 마이크로소프트가 자사의 수백만 건 기사를 무단으로 사용하여 대규모 언어 모델(LLM)을 훈련시켰다고 주장하며 막대한 손해배상을 청구하고 있다는 점입니다. NYT는 자사 콘텐츠가 LLM의 답변에 재현되거나 허위 정보를 생성하는 데 사용되었다고 지적합니다. 이는 창작자들이 투자한 시간과 자원을 AI 기업들이 무단으로 사용하여 상업적 이득을 취한다는 주장입니다. 오픈AI와 마이크로소프트는 웹 공개 데이터를 사용하는 것은 '공정 사용(fair use)' 원칙에 해당하며, AI 모델 학습에 필수적이라고 항변해 왔습니다. 이들은 혁신적인 AI 개발을 위해서는 방대한 데이터셋 접근이 불가피하며, 제한 시 기술 발전을 저해할 것이라는 입장입니다. 그러나 러셀 이사와 루벤 책임자의 내부 발언은 이러한 공개 주장 뒤에 가려진 기업 내부의 윤리적, 법적 고뇌를 여실히 보여줍니다. 즉, 공개적으로는 합법성을 주장하면서도, 내부적으로는 파괴적 영향과 저작권 침해 가능성을 깊이 인지하고 있었던 셈입니다. 이러한 논쟁은 AI 기술 시대의 저작권 문제와 관련하여 여러 중요한 쟁점을 부각시킵니다.
  • AI 개발 기업의 무단 데이터 사용이 저작권자의 정당한 보상을 침해하는지 여부
  • '공정 사용' 원칙이 AI 학습 데이터 수집에 어떻게 적용되어야 하는지
  • 생성형 AI 모델이 원본 콘텐츠를 모방하거나 재생성할 때의 책임 범위
  • 콘텐츠 생산자와 AI 개발자 간의 공존을 위한 새로운 비즈니스 모델 및 라이선싱 필요성
일각에서는 AI 모델의 성능 향상을 위해 대규모 데이터 스크래핑이 불가피하며, 접근 제한은 AI 발전을 저해할 수 있다고 주장합니다. 그러나 이는 창작 생태계의 지속 가능성을 간과하는 위험이 있습니다. 콘텐츠 제작자들이 정당한 대가 없이 노동력을 도용당한다고 느끼면, 고품질 콘텐츠 생산 동기가 저하되고 장기적으로 AI 모델이 학습할 양질의 데이터 자체가 고갈될 수 있습니다. 결국, AI 발전이 인류의 지식과 창의성에 기반하는 만큼, 이 기반을 훼손하지 않는 지속 가능한 모델이 필요하다는 반론이 더욱 설득력을 얻습니다. 이번 소송은 인공지능 시대의 지적 재산권 보호, 창작자의 권리, 그리고 AI 산업의 지속 가능한 발전을 위한 중요한 이정표가 될 것입니다. 법원의 판결에 따라 AI 모델 학습 방식, 데이터 수집 정책, 그리고 콘텐츠 라이선싱 시장에 근본적인 변화가 일어날 가능성이 크며, 이는 텍스트뿐 아니라 이미지, 음악, 영상 등 모든 창작 영역에 영향을 미칠 것입니다. 업계 전문가들은 이번 사례가 AI와 콘텐츠 산업의 미래 관계를 재정의할 중대한 전환점이 될 것으로 보고 있습니다.
인사이트

이번 마이크로소프트 임원의 발언은 AI 학습 데이터 스크래핑이 단순한 기술적 문제가 아닌, 창작 노동의 가치와 지적 재산권 보호라는 근본적인 윤리 및 법적 쟁점임을 명확히 보여주며, AI 시대의 지속 가능한 창작 생태계를 위한 새로운 기준 마련의 필요성을 강조합니다.

자주 묻는 질문

AI 학습 데이터 스크래핑이 정확히 뭔가요?
AI 학습 데이터 스크래핑은 웹사이트나 데이터베이스에서 대량의 정보를 자동으로 추출하여 인공지능 모델을 훈련시키는 데 사용하는 행위를 말합니다. LLM의 경우, 인터넷에 공개된 방대한 텍스트 데이터를 수집하는 것이 일반적입니다.
마이크로소프트와 오픈AI는 왜 이런 논란에 휩싸였나요?
뉴욕 타임스가 자사의 저작물을 무단으로 스크래핑하여 LLM을 훈련시켰다고 두 회사를 고소했기 때문입니다. 이 과정에서 마이크로소프트와 오픈AI 내부 관계자들의 우려를 표명한 발언이 공개되어 논란이 커졌습니다.
이 소송 결과가 AI 산업에 어떤 영향을 미칠까요?
소송 결과에 따라 AI 모델 학습을 위한 데이터 수집 방식과 저작권 침해 기준이 재정립될 수 있습니다. 이는 AI 기업들의 비즈니스 모델과 콘텐츠 제작자들의 보상 체계에 근본적인 변화를 가져올 중대한 선례가 될 것입니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.