JIINSI
논문 브리핑

AI 토킹 헤드, '새는 입' 문제 극복? PD-GS가 여는 자연스러운 조음의 시대

한경모글 · 한경모
음소 기반 3D 가우시안 스프레딩 기술(PD-GS)이 적용된 AI 토킹 헤드가 실제 사람처럼 자연스럽고 정확한 입술 움직임을 구현하고 있는 모습.
음소 기반 3D 가우시안 스프레딩 기술(PD-GS)이 적용된 AI 토킹 헤드가 실제 사람처럼 자연스럽고 정확한 입술 움직임을 구현하고 있는 모습.
최근 유튜브, 광고, 메타버스 등 다양한 미디어에서 AI 토킹 헤드, 즉 가상 인간의 활용이 빠르게 늘고 있습니다. 하지만 이들을 자세히 들여다보면 부자연스러운 부분을 발견할 때가 많죠. 특히 입술 움직임이 음성과 완벽하게 동기화되지 않거나, 특정 발음에서 어색한 모습이 대표적입니다. 이처럼 AI 토킹 헤드의 사실감을 저해하는 주요 원인 중 하나가 바로 '새는 입(leaky mouth)' 현상입니다. '새는 입' 현상은 '프(p)', '브(b)', '므(m)'와 같이 입술이 완전히 닫혔다가 터지면서 나는 파열음이나 양순음(bilabial)을 발음할 때, 디지털 캐릭터의 입술이 실제와 달리 미처 다 닫히지 못하고 어색하게 벌어져 보이는 것을 말합니다. 현재 3D Gaussian Splatting(3DGS)이 포토리얼리스틱한 렌더링을 가능하게 해도, 이 고질적인 문제를 해결하지 못하는 근본적인 이유가 있습니다. 대부분 기존 AI 토킹 헤드는 연속적인 음향 임베딩으로 입술 움직임을 유추합니다. 짧고 이산적인 '입술 닫힘' 같은 조음 동작의 물리적 제약을 연속적인 데이터에서 정확히 포착하기 어려워, 입 모양 예측이 평균적인 움직임으로 수렴하면서 결정적인 조음 순간을 놓칩니다. 최근 아카이브(arXiv)에 공개된 'PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads' 논문은 이 '새는 입' 현상 해결책을 제시하며 AI 토킹 헤드 기술의 새로운 지평을 엽니다. 이 연구는 단순히 연속적인 음향 정보에 의존하는 기존 방식에서 벗어나, '음소(phoneme)'라는 언어학적 단위를 3DGS 파이프라인에 직접 통합합니다. 음소는 언어에서 의미를 구분하는 가장 작은 소리 단위이며, 각각 고유한 조음 방식과 입 모양을 가집니다. PD-GS는 이러한 음소 정보를 활용하여 특정 음소가 발음될 때 캐릭터의 입술이 어떻게 움직여야 하는지, 특히 입술이 완전히 닫혀야 하는 시점을 매우 정확하게 지시합니다. 이를 통해 PD-GS는 '새는 입' 같은 어색한 아티팩트(artifact)를 효과적으로 제거하고, 훨씬 더 사실적이고 정확한 조음(articulation)을 가능하게 합니다. 기존 방식이 음향적 특징으로 입 모양을 추정했다면, PD-GS는 '이 소리에는 입술이 완전히 닫혀야 한다'는 명확한 이산적 조음 제약을 부여합니다. 이 접근 방식은 디지털 휴먼의 입술 움직임을 정교하게 제어하여, 발화 내용과 완벽히 일치하는 시각적 표현을 구현합니다. 가상 인플루언서, AI 튜터, 실시간 통역 아바타, 메타버스 아바타 등 다양한 분야에서 디지털 휴먼의 신뢰도와 사용자 경험을 획기적으로 향상시킬 수 있습니다. 특히 몰입감 높은 가상현실 환경이나 현실적인 영상 콘텐츠 제작에 필수적인 요소가 될 것입니다. 업계 전문가들은 이 기술이 AI 가상 캐릭터가 인간과의 소통에서 더 자연스러움을 획득하는 중요한 이정표가 될 것이라고 평가합니다. 물론 모든 소리가 음소로만 구성되진 않으며, 음성의 미묘한 뉘앙스나 감정 표현까지 완벽히 구현하는 데는 추가 연구가 필요합니다. 하지만 '새는 입'처럼 명확한 물리적 제약 조건을 해결했다는 점은 가장 큰 걸림돌 중 하나를 제거한 것입니다. PD-GS는 이러한 결정적인 제약을 처리함으로써, 더 복잡한 감정 표현이나 개인화된 발화 스타일 구현의 견고한 기반을 마련했습니다. 이 연구의 핵심 비교 및 쟁점은 다음과 같습니다.
  • 기존 3DGS 방식의 한계: 연속적 음향 임베딩이 이산적 조음(예: 입술 닫힘)을 정확히 구현하기 어려워 '새는 입' 현상 발생.
  • PD-GS의 혁신: 음소 기반의 이산적 조음 지시를 3DGS 파이프라인에 통합하여 물리적 제약(입술 닫힘)을 정확히 처리.
  • 기대 효과: 훨씬 더 자연스럽고 사실적인 입술 움직임과 발음 정확성 구현.
  • 산업적 의미: 가상 인플루언서, 메타버스 아바타, AI 튜터 등 디지털 휴먼 전반의 사용자 경험 및 신뢰도 향상.
마이크로소프트, 구글, 메타 등 빅테크 기업들이 가상 비서나 메타버스 아바타 개발에 막대한 투자를 하고 있는 상황에서, PD-GS와 같은 기술은 이들 디지털 휴먼의 현실감을 한 단계 끌어올리는 중요한 퍼즐 조각이 될 것입니다. 이는 단순히 '말하는' 아바타를 넘어 '정확하고 자연스럽게 표현하는' 아바타로의 전환을 의미하며, 미래의 디지털 상호작용은 PD-GS와 같은 기술 혁신을 통해 훨씬 더 몰입감 있고 사실적인 경험을 제공할 것으로 기대됩니다.
인사이트

PD-GS는 AI 토킹 헤드의 고질적인 '새는 입' 현상을 음소 기반의 이산적 조음 제어로 해결하며, 디지털 휴먼의 사실감과 표현력을 한 단계 끌어올릴 핵심적인 기술입니다. 이는 가상 인플루언서부터 메타버스 아바타까지, 더욱 자연스럽고 신뢰도 높은 디지털 상호작용의 시대를 열어줄 것입니다.

자주 묻는 질문

'새는 입' 현상이 정확히 뭔가요?
'새는 입' 현상은 AI 토킹 헤드가 '프, 브, 므'처럼 입술을 완전히 닫아야 하는 소리를 발음할 때, 실제처럼 입술이 완전히 닫히지 않고 벌어져 어색하게 보이는 현상입니다. 기존 기술이 연속적인 음향 정보만으로 입 모양을 유추하기 때문에 생기는 문제입니다. 이는 디지털 휴먼의 사실감을 크게 떨어뜨립니다.
PD-GS가 음소를 쓴다는 게 어떤 기술적인 의미가 있나요?
PD-GS는 소리의 최소 단위인 음소를 활용하여 특정 소리(음소)가 발음될 때 입술이 어떻게 움직여야 하는지, 특히 입술이 완전히 닫혀야 하는 시점을 정확히 지시합니다. 이는 연속적인 음향 데이터에서 입 모양을 추정하는 대신, 이산적인 언어학적 정보로 물리적 제약을 명확히 처리한다는 기술적 의미가 있습니다. 결과적으로 훨씬 더 정확하고 자연스러운 입술 움직임을 구현합니다.
이 기술이 실제 어디에 쓰일 수 있을까요?
PD-GS 기술은 가상 인플루언서, AI 튜터, 실시간 통역 아바타, 메타버스 아바타 등 다양한 디지털 휴먼 분야에 적용될 수 있습니다. 특히 발화의 정확성과 자연스러움이 중요한 교육, 고객 서비스, 엔터테인먼트 콘텐츠 등에서 디지털 휴먼의 사용자 경험과 신뢰도를 획기적으로 높일 것으로 기대됩니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.