JIINSI
기술 트렌드

GPT-5.6, 클로드, 제미나이, 그록이 '텍스트로 그린' 모나리자, 보이지 않는 AI 그림 실력의 민낯

정우석글 · 정우석
인공지능 모델별 모나리자 그림 지시 텍스트를 분석하여, 각 모델의 시각적 추론 및 지시 생성 능력을 비교한 자료.
인공지능 모델별 모나리자 그림 지시 텍스트를 분석하여, 각 모델의 시각적 추론 및 지시 생성 능력을 비교한 자료.
최근 인공지능 커뮤니티에서 주요 거대 언어 모델(LLM)들이 텍스트만으로 ‘모나리자를 색연필로 그리는 방법’을 얼마나 상세하고 정확하게 설명하는지를 비교하는 흥미로운 실험 결과가 큰 화제를 모았습니다. 이는 단순히 그림을 생성하는 것이 아니라, 복잡한 시각적 정보를 단계별 지시로 풀어내는 LLM의 잠재력과 한계를 동시에 보여주는 중요한 시사점을 던졌습니다. 오픈AI의 GPT-5.6(가칭), 앤트로픽의 클로드, 구글의 제미나이, 그리고 xAI의 그록 등 대표적인 모델들이 이번 ‘드로잉 아레나’에 참여했습니다. 이번 실험의 핵심은 LLM이 이미지 생성 능력이 없어도, 복잡한 시각적 개념을 얼마나 잘 이해하고 구체적인 작업 지시로 변환할 수 있는가에 있었습니다. 참여 모델들은 모나리자의 특징적인 미소, 스푸마토 기법, 배경 풍경 등을 색연필로 표현하기 위한 구체적인 색상 선택과 레이어링 기법을 지시해야 했습니다. 이는 예술 지식, 색상 이론, 그리고 복잡한 과정을 논리적으로 분해하는 추론 능력이 복합적으로 요구되는 과제였습니다. 각 모델의 성능은 극명한 차이를 보였습니다.
  • GPT-5.6은 가장 높은 평가를 받았습니다. 그림의 구도, 인물의 특징, 색연필의 레이어링 기법과 명암 표현까지 상세하고 일관된 지시를 제공하며, 마치 실제 미술 교사가 설명하는 듯한 전문성을 드러냈습니다. 복잡한 스푸마토 기법을 단계별로 설명하는 방식이 특히 인상 깊었습니다.
  • 클로드 역시 매우 강력한 성능을 보여주며, 체계적이고 명확한 지시로 높은 신뢰도를 얻었습니다. GPT-5.6과 유사하게 상세한 묘사를 제공했지만, 미묘한 예술적 감각 표현에서는 약간의 차이를 보였습니다.
  • 제미나이는 초기 단계에서는 괜찮은 지시를 제공했으나, 모나리자의 특징적인 미소나 배경의 깊이감 표현 등 섬세한 디테일로 갈수록 지시의 구체성이 떨어지고 일반적인 색연필 그림 설명과 크게 다르지 않다는 평가를 받았습니다.
  • 그록은 다른 모델들과는 다른 독특하고 창의적인 접근 방식을 시도했지만, 그만큼 정확성이나 실제 그림 과정에 적용하기에는 다소 부족한 지시를 내놓아 아쉬움을 남겼습니다. 일관성이 부족하다는 지적이 많았습니다.
일각에서는 이러한 실험이 단순히 유희에 불과하다고 평가절하할 수도 있습니다. 그러나 업계 전문가들은 이 실험이 LLM의 '보이지 않는 그림 실력', 즉 복합적인 지식과 추론 능력을 평가하는 중요한 척도가 된다고 입을 모읍니다. 이미지 생성 모델이 아님에도 불구하고, 텍스트를 통해 시각적 요소를 얼마나 정확하고 깊이 있게 이해하는지는 모델의 범용성과 향후 멀티모달 기능 확장 가능성을 가늠케 합니다. 이는 오픈AI, 앤트로픽, 구글, xAI 등 거대 기술 기업들이 첨예하게 경쟁하는 LLM 시장에서 각 모델의 기술적 우위를 간접적으로 보여주는 지표가 될 수 있습니다. 이번 실험 결과는 LLM이 단순한 텍스트 생성기를 넘어, 복잡한 지식을 통합하고 추론하며 실세계 문제 해결에 기여할 수 있는 잠재력을 다시 한번 확인시켜 줍니다. 앞으로 LLM이 텍스트와 시각, 청각 등 다양한 양식의 정보를 통합적으로 처리하는 멀티모달 시대로 진화할수록, 이처럼 복합적인 '상상력'과 '묘사력'은 더욱 중요한 가치를 지닐 것으로 전망됩니다. 예술 교육, 디자인 가이드, 심지어는 공학적 설계 지시 등 다양한 분야에서 LLM의 역할이 확대될 여지를 엿볼 수 있습니다.
인사이트

이번 LLM들의 '모나리자 그리기' 텍스트 실험은 시각적 추론과 복합적 지식 활용 능력의 차이를 극명하게 보여주며, 멀티모달 AI 시대로 나아가는 LLM의 핵심 경쟁력을 가늠케 합니다.

자주 묻는 질문

LLM이 진짜 그림을 그리는 게 아니라 텍스트로 설명만 하는 건데, 이게 왜 중요한가요?
이 실험은 LLM이 시각적 정보를 얼마나 깊이 이해하고, 그 정보를 바탕으로 복잡한 과정을 논리적으로 추론하여 구체적인 지시로 변환할 수 있는지를 보여줍니다. 이는 LLM의 추론 능력, 지식 활용 능력, 그리고 멀티모달 시대로의 확장 가능성을 평가하는 중요한 지표가 됩니다.
GPT-5.6이 제일 좋다고 하는데, 아직 공식 출시된 모델인가요?
아직 'GPT-5.6'이라는 이름으로 공식 출시된 모델은 없습니다. 이번 실험에서는 최신 연구 또는 비공개 테스트 버전의 성능을 가리키거나, GPT-4 또는 그 이상 버전의 잠재적 성능을 지칭하는 것으로 해석됩니다. 실제 시장에 출시될 때는 다른 이름이나 형태로 등장할 수 있습니다.
이런 능력이 발전하면 어떤 분야에 활용될 수 있을까요?
텍스트를 통해 시각적 예술을 섬세하게 묘사하는 능력은 예술 교육 콘텐츠 제작, 디자인 가이드라인 제시, 복잡한 공학 설계 과정 설명 등에 활용될 수 있습니다. 또한, 시각 장애인을 위한 상세한 이미지 설명이나 인터랙티브 스토리텔링 등 다양한 분야에서 혁신적인 사용자 경험을 제공할 잠재력이 있습니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.