JIINSI
논문 브리핑

Pass@K와 Pass@1의 간극, LLM 잠재력 끌어올릴 새로운 학습법 제시

한경모글 · 한경모
인공지능 언어 모델의 추론 결과를 시각화한 그래프가 Pass@K와 Pass@1 성능 격차를 선명하게 보여주는 모습.
인공지능 언어 모델의 추론 결과를 시각화한 그래프가 Pass@K와 Pass@1 성능 격차를 선명하게 보여주는 모습.
인공지능 언어 모델(LLM)이 복잡한 문제를 해결하는 능력이 날마다 발전하고 있지만, 여전히 많은 사용자와 개발자들은 LLM의 ‘들쭉날쭉한’ 성능에 아쉬움을 느낍니다. 특히 단 한 번의 시도로 정확한 답변을 얻는 Pass@1 성능과, 여러 번 시도하여 그 중 최적의 답변을 선택하는 Pass@K 성능 사이의 격차는 LLM 활용의 중요한 쟁점 중 하나였습니다. 최근 아카이브(arXiv)에 공개된 한 논문은 이 Pass@K와 Pass@1 사이의 간극을 심도 깊게 탐구하며, LLM의 숨겨진 잠재력을 끌어올릴 새로운 학습 패러다임을 제시해 눈길을 끕니다. 이 논문, 'Learning from the Gap Between Pass@K and Pass@1'은 검증 가능한 보상 학습(RLVR, Reinforcement Learning from Verifiable Rewards)으로 학습된 LLM의 동작을 분석하며 시작합니다. RLVR은 외부 검증자를 통해 모델의 응답이 정확한지 판단하고, 그에 따라 보상을 주어 모델을 개선하는 방식입니다. 여기서 핵심은 정확한 검증자가 존재할 경우, 추론 시 여러 샘플을 생성하고 그 중 가장 좋은 것을 선택하는 '테스트 시간 스케일링(test-time scaling)'을 통해 Pass@K 성능을 크게 높일 수 있다는 점입니다. 하지만 대부분의 실제 서비스 환경에서는 자원 효율성을 위해 단일 샘플 디코딩, 즉 Pass@1 성능이 중요하게 다뤄집니다. 연구팀은 현재의 LLM 학습 방식이 Pass@K 성능 향상에 크게 기여하는 '검색 노출 행동(search-exposed behavior)'을 Pass@1 성능으로 효과적으로 흡수하지 못하고 있다는 점에 주목했습니다. 즉, 모델은 여러 시도를 통해 정답을 찾아내는 방법을 학습했지만, 한 번의 시도로도 그 능력을 발휘하도록 최적화되지 않았다는 것입니다. 기존 RLVR 기반의 후처리 학습 방식들이 이미 해결된 문제와 해결되지 않은 문제를 명확히 구분하지 못하여 학습 효율성이 떨어지는 경향이 있음을 지적하며, 이 간극에서 새로운 학습 기회를 발견한 것입니다. 본 연구의 핵심 아이디어는 Pass@K와 Pass@1 사이의 격차 자체가 모델이 무엇을 더 학습해야 하는지에 대한 중요한 신호를 담고 있다는 것입니다. 이들은 이 격차를 체계적으로 분석하고, 이를 통해 모델이 단일 샘플 디코딩 환경에서도 더 나은 성능을 보이도록 학습하는 새로운 방법을 모색합니다. 이는 LLM이 단순히 정답을 '찾는' 것을 넘어, 처음부터 '제대로' 정답을 생성하도록 유도하는 패러다임의 전환을 의미합니다. 만약 이 방법이 효과적으로 구현된다면, 다음과 같은 긍정적인 파급 효과를 기대할 수 있습니다.
  • 추론 비용 절감: 여러 번 샘플링할 필요 없이 한 번의 시도로 높은 정확도를 얻을 수 있어, LLM 운영에 드는 컴퓨팅 자원과 비용을 대폭 줄일 수 있습니다.
  • 응답 속도 향상: 복잡한 검색 과정 없이 즉각적으로 고품질의 응답을 제공하여 사용자 경험을 크게 개선합니다.
  • LLM의 신뢰성 증대: 특히 민감하거나 중요한 분야에서 LLM을 활용할 때, 단일 추론 결과의 신뢰도를 높여 적용 범위를 넓힐 수 있습니다.
물론 이러한 연구가 모든 LLM 문제에 만능 해결책은 아닙니다. 복잡한 문제나 창의적 추론이 필요한 영역에서는 여전히 다양한 샘플링과 검색 전략이 필요할 수 있습니다. 또한, 이 '간극 학습' 방법이 모든 종류의 검증자와 모든 데이터셋에서 일관된 효과를 보일지에 대한 추가적인 검증이 필요합니다. 하지만 업계 전문가들은 LLM의 근본적인 효율성과 신뢰성을 높이려는 이러한 시도에 큰 기대를 걸고 있습니다. 특히 엔비디아나 구글과 같은 주요 LLM 개발사들이 추론 비용 절감과 성능 최적화에 집중하고 있는 만큼, 이 연구는 실제 제품 및 서비스 개발에 중요한 통찰을 제공할 것입니다. 결론적으로, 'Learning from the Gap Between Pass@K and Pass@1'은 LLM의 학습 효율성을 극대화하고, 단일 샘플 추론의 정확도를 높이는 혁신적인 접근법을 제시합니다. 이는 LLM이 더욱 똑똑하고 효율적으로 작동하도록 만드는 핵심 열쇠가 될 수 있으며, 장기적으로는 인공지능이 우리 일상에 더욱 깊숙이 파고드는 촉매 역할을 할 것입니다. 앞으로 이 연구가 어떤 방향으로 발전하여 실제 LLM 성능 향상에 기여할지 주목해야 할 때입니다.
인사이트

Pass@K와 Pass@1 사이의 격차를 활용하여 LLM의 학습 효율과 단일 샘플 추론 정확도를 높이는 본 연구는 인공지능 모델의 실제 적용 가능성과 비용 효율성을 혁신할 잠재력을 보여줍니다.

자주 묻는 질문

Pass@K와 Pass@1이 정확히 무엇인가요? 왜 이 둘의 격차가 중요한가요?
Pass@1은 LLM이 한 번의 시도로 정답을 맞출 확률을 의미하며, Pass@K는 K번 시도하여 그중 하나라도 정답이면 성공으로 보는 확률입니다. 이 격차는 모델이 여러 시도에서는 정답을 찾지만 한 번에 바로 내놓는 데는 어려움이 있음을 보여주며, 학습 효율성 개선의 중요한 단서를 제공합니다.
이 연구가 LLM 사용자들이 체감하는 서비스에 어떤 영향을 미칠까요?
이 연구를 통해 LLM이 단 한 번의 추론으로도 더 정확하고 신뢰할 수 있는 답변을 제공할 수 있게 됩니다. 이는 사용자 질의에 대한 응답 속도를 높이고, 불필요한 재질의를 줄여 더욱 원활하고 만족스러운 LLM 기반 서비스 경험을 가능하게 할 것입니다.
이 학습 방식이 모든 종류의 인공지능 언어 모델에 적용 가능한가요? 한계는 없나요?
이 연구는 특히 검증 가능한 보상 학습(RLVR) 환경에 초점을 맞추고 있으며, 특정 종류의 문제나 환경에서 더 효과적일 수 있습니다. 창의적이거나 복잡한 추론을 요구하는 작업에서는 여전히 여러 샘플링 전략이 필요할 수 있으며, 범용적인 적용 가능성은 추가 연구를 통해 검증이 필요합니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.