기술 트렌드
GPT-5.6, 클로드, 제미나이, 그록이 '텍스트로 그린' 모나리자, 보이지 않는 AI 그림 실력의 민낯

최근 인공지능 커뮤니티에서 주요 거대 언어 모델(LLM)들이 텍스트만으로 ‘모나리자를 색연필로 그리는 방법’을 얼마나 상세하고 정확하게 설명하는지를 비교하는 흥미로운 실험 결과가 큰 화제를 모았습니다. 이는 단순히 그림을 생성하는 것이 아니라, 복잡한 시각적 정보를 단계별 지시로 풀어내는 LLM의 잠재력과 한계를 동시에 보여주는 중요한 시사점을 던졌습니다. 오픈AI의 GPT-5.6(가칭), 앤트로픽의 클로드, 구글의 제미나이, 그리고 xAI의 그록 등 대표적인 모델들이 이번 ‘드로잉 아레나’에 참여했습니다.
이번 실험의 핵심은 LLM이 이미지 생성 능력이 없어도, 복잡한 시각적 개념을 얼마나 잘 이해하고 구체적인 작업 지시로 변환할 수 있는가에 있었습니다. 참여 모델들은 모나리자의 특징적인 미소, 스푸마토 기법, 배경 풍경 등을 색연필로 표현하기 위한 구체적인 색상 선택과 레이어링 기법을 지시해야 했습니다. 이는 예술 지식, 색상 이론, 그리고 복잡한 과정을 논리적으로 분해하는 추론 능력이 복합적으로 요구되는 과제였습니다.
각 모델의 성능은 극명한 차이를 보였습니다.
- GPT-5.6은 가장 높은 평가를 받았습니다. 그림의 구도, 인물의 특징, 색연필의 레이어링 기법과 명암 표현까지 상세하고 일관된 지시를 제공하며, 마치 실제 미술 교사가 설명하는 듯한 전문성을 드러냈습니다. 복잡한 스푸마토 기법을 단계별로 설명하는 방식이 특히 인상 깊었습니다.
- 클로드 역시 매우 강력한 성능을 보여주며, 체계적이고 명확한 지시로 높은 신뢰도를 얻었습니다. GPT-5.6과 유사하게 상세한 묘사를 제공했지만, 미묘한 예술적 감각 표현에서는 약간의 차이를 보였습니다.
- 제미나이는 초기 단계에서는 괜찮은 지시를 제공했으나, 모나리자의 특징적인 미소나 배경의 깊이감 표현 등 섬세한 디테일로 갈수록 지시의 구체성이 떨어지고 일반적인 색연필 그림 설명과 크게 다르지 않다는 평가를 받았습니다.
- 그록은 다른 모델들과는 다른 독특하고 창의적인 접근 방식을 시도했지만, 그만큼 정확성이나 실제 그림 과정에 적용하기에는 다소 부족한 지시를 내놓아 아쉬움을 남겼습니다. 일관성이 부족하다는 지적이 많았습니다.
인사이트
이번 LLM들의 '모나리자 그리기' 텍스트 실험은 시각적 추론과 복합적 지식 활용 능력의 차이를 극명하게 보여주며, 멀티모달 AI 시대로 나아가는 LLM의 핵심 경쟁력을 가늠케 합니다.
자주 묻는 질문
- LLM이 진짜 그림을 그리는 게 아니라 텍스트로 설명만 하는 건데, 이게 왜 중요한가요?
- 이 실험은 LLM이 시각적 정보를 얼마나 깊이 이해하고, 그 정보를 바탕으로 복잡한 과정을 논리적으로 추론하여 구체적인 지시로 변환할 수 있는지를 보여줍니다. 이는 LLM의 추론 능력, 지식 활용 능력, 그리고 멀티모달 시대로의 확장 가능성을 평가하는 중요한 지표가 됩니다.
- GPT-5.6이 제일 좋다고 하는데, 아직 공식 출시된 모델인가요?
- 아직 'GPT-5.6'이라는 이름으로 공식 출시된 모델은 없습니다. 이번 실험에서는 최신 연구 또는 비공개 테스트 버전의 성능을 가리키거나, GPT-4 또는 그 이상 버전의 잠재적 성능을 지칭하는 것으로 해석됩니다. 실제 시장에 출시될 때는 다른 이름이나 형태로 등장할 수 있습니다.
- 이런 능력이 발전하면 어떤 분야에 활용될 수 있을까요?
- 텍스트를 통해 시각적 예술을 섬세하게 묘사하는 능력은 예술 교육 콘텐츠 제작, 디자인 가이드라인 제시, 복잡한 공학 설계 과정 설명 등에 활용될 수 있습니다. 또한, 시각 장애인을 위한 상세한 이미지 설명이나 인터랙티브 스토리텔링 등 다양한 분야에서 혁신적인 사용자 경험을 제공할 잠재력이 있습니다.
이 기사 어땠어요?
피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.