한경모의 논문 노트 · 2026-10-04
AI 학습의 '국민조합', 그 성공 비결을 10년 만에 해부하다
지난 10년간 AI 모델 훈련의 표준 도구였던 'Adam'의 성공은 일종의 미스터리였습니다. 최근 발표된 한 논문은 Adam이 이론상 가장 완벽한 방법론을 현실적으로 모방한 '영리한 근사치'임을 밝혀내며, 그 작동 원리의 비밀을 처음으로 규명했습니다.

“결국 중요한 것은 예언이 아니라 메커니즘입니다. Adam의 성공이 마법이 아니라 정교한 근사였음을 이해하는 순간, 우리는 비로소 다음 단계의 혁신을 설계할 수 있게 됩니다.”
인공지능(AI)을 훈련시키는 과정은 종종 험준한 산에서 가장 낮은 계곡을 찾는 일에 비유됩니다. 모델이 똑똑해진다는 것은, 정답과의 오차(손실)라는 계곡의 가장 깊은 지점을 찾아 내려가는 과정과 같습니다. 이때 어떤 경로로, 얼마나 큰 보폭으로 내려갈지 결정하는 나침반이자 등산화가 바로 '옵티마이저(optimizer, 최적화기)'입니다. 수많은 옵티마이저 중에서도 지난 10년간 거의 모든 AI 연구자와 개발자가 의심 없이 사용해 온 '국민 장비'가 있습니다. 바로 '아담(Adam)'입니다.
2014년 등장한 Adam 덕분에 거대하고 복잡한 딥러닝 모델의 훈련은 이전보다 훨씬 빠르고 안정적으로 이루어질 수 있었습니다. 우리가 오늘날 사용하는 챗GPT 같은 거대 언어 모델(LLM, 쉽게 말해 사람 말을 흉내 내 문장을 만들어 내는 AI)의 탄생 역시 Adam의 기여 없이는 상상하기 어렵습니다. 그런데 이상한 점이 있습니다. Adam은 지난 10년간 압도적인 성공을 거뒀지만, '왜' 그렇게 잘 작동하는지에 대한 명확한 이론적 설명은 부족했습니다. 그저 경험적으로 '써보니 좋더라'는 평판이 지배적이었습니다. 최근 이 오래된 질문에 답하는 흥미로운 논문 한 편이 공개되었습니다.
AI 학습의 보이지 않는 손, '옵티마이저'
AI 모델을 처음 만들면, 그 속은 거의 백지와 같습니다. 수십, 수억 개에 달하는 '파라미터(parameter, 모델의 성능을 결정하는 내부 설정값)'들이 무작위로 채워져 있습니다. 이 모델에 데이터를 보여주고 정답을 알려주면서, 파라미터들을 정답에 가까운 방향으로 아주 조금씩 조정해나가는 과정이 바로 '학습' 또는 '훈련'입니다.
이때 옵티마이저는 두 가지 핵심 질문에 답해야 합니다.
- '어느 방향으로 조정할 것인가?' (방향)
- '얼마나 많이 조정할 것인가?' (보폭, 또는 학습률)
가장 기본적인 방법은 '경사 하강법(Gradient Descent)'입니다. 현재 위치에서 가장 가파른 내리막길 방향으로 한 걸음 내딛는 방식입니다. 단순하지만, 몇 가지 문제가 있습니다. 너무 큰 보폭으로 걸으면 계곡의 바닥을 지나쳐 반대편으로 튕겨 나갈 수 있고, 너무 작은 보폭으로 걸으면 어느 세월에 바닥에 도착할지 알 수 없습니다. 또, 전체 지형에서 보면 잘못된 방향인데 국지적으로만 가파른 함정에 빠질 수도 있습니다.
Adam은 바로 이 방향과 보폭 문제를 아주 영리하게 해결했습니다. 과거에 움직였던 방향을 기억해 관성을 주는 '모멘텀(momentum)' 방식과, 각 파라미터마다 처한 상황에 맞춰 보폭을 자동으로 조절해주는 '적응적 학습률(adaptive learning rate)' 방식을 결합한 것입니다. 덕분에 개발자들은 복잡한 튜닝 없이도 대부분의 문제에서 안정적인 학습 결과를 얻을 수 있었습니다. 마치 어떤 산이든 무난하게 오를 수 있는 전천후 등산화처럼 말입니다. 하지만 그 편리함 뒤에 숨은 작동 원리는 여전히 안갯속이었습니다.
이상적이지만 비현실적인 나침반, '자연 경사 하강법'
Adam의 비밀을 이해하려면, 먼저 이론적으로 가장 이상적인 옵티마이저로 알려진 '자연 경사 하강법(Natural Gradient Descent, NGD)'을 알아야 합니다. 일반 경사 하강법이 현재 위치의 '기울기'만 본다면, NGD는 한 단계 더 나아가 파라미터 공간 전체의 '지형' 또는 '곡률'을 함께 고려합니다.
쉬운 비유를 들어보겠습니다. 서울에서 부산까지 가장 빨리 가는 길을 찾는다고 가정합시다. 일반 경사 하강법은 지금 내가 선 자리에서 남쪽으로 가장 가파른 내리막길만 보고 무작정 직진하는 방식입니다. 그러다 보면 대전쯤에서 길이 막히거나, 산을 만나 돌아가야 할 수 있습니다.
반면 NGD는 인공위성으로 한반도 전체의 지형과 도로망을 한눈에 파악하는 것과 같습니다. 단순히 남쪽 방향이 아니라, 모든 지형 정보를 고려해 계산된 '기하학적 최단 경로'인 경부고속도로를 따라 이동합니다. 파라미터의 관점에서도, 1만큼 움직였을 때 모델의 정보량(확률 분포)이 가장 효율적으로 변하는 경로를 찾아냅니다. 이론적으로는 가장 빠르고 정확한 길입니다.
하지만 여기에는 치명적인 문제가 있습니다. NGD가 사용하는 위성 지도, 즉 '피셔 정보 행렬(Fisher Information Matrix)'을 계산하고 처리하는 비용이 천문학적입니다. 파라미터가 N개인 모델에서 이 행렬의 크기는 N x N에 비례합니다. 수천억 개 파라미터를 가진 최신 AI 모델에서 이 행렬을 매 걸음마다 새로 계산하는 것은, 슈퍼컴퓨터를 총동원해도 사실상 불가능합니다. '그림의 떡'인 셈입니다. 그래서 학계는 오랫동안 NGD를 이론적 이상향으로만 여길 뿐, 실용적인 대안을 찾아왔습니다.
'국민 조합' Adam, 그 절묘한 타협의 원리
최근 공개된 논문 'How Far is Adam from Natural Gradient Descent?'는 바로 이 지점에서 출발합니다. 결론부터 말하면, Adam은 비현실적인 NGD를 현실 세계에서 쓸 수 있도록 만든 매우 성공적인 '근사치'이자 '타협안'이라는 것입니다. Adam의 성공이 우연이나 마법이 아니라, NGD의 핵심 철학을 실용적으로 구현한 결과라는 사실을 수학적으로 보인 첫 시도입니다.
논문에 따르면 Adam은 다음과 같은 방식으로 NGD를 흉내 냅니다.
- 대각선 근사: NGD의 완벽한 '위성 지도'(피셔 정보 행렬)를 통째로 계산하는 대신, 지도의 대각선 성분, 즉 각 파라미터의 개별적인 변화량 정보만 활용합니다. 이는 전체 도로망을 보는 대신, 각 차선이 얼마나 혼잡한지만 보고 경로를 결정하는 것과 비슷합니다. 정보 손실이 크지만 계산은 비교할 수 없이 빨라집니다.
- 경험적 추정: 이론적인 피셔 정보 행렬 대신, 실제 학습 과정에서 관찰된 기울기 값(경험적 피셔 정보 행렬)을 사용합니다. 이론적인 교통량을 예측하는 대신, 실시간 CCTV로 관측된 교통량 데이터를 쓰는 셈입니다.
- 시간적 지연과 평활화: Adam은 과거의 기울기 정보를 지수적으로 평균 내어 사용합니다(이것이 모멘텀과 RMSProp의 핵심입니다). 논문은 이것이 NGD 계산을 시간적으로 약간 지연시키고 부드럽게 만드는 효과를 낳는다고 분석합니다. 순간적인 노이즈에 휘둘리지 않고 전체적인 흐름을 따르게 해 안정성을 높이는 장치입니다.
결국 Adam의 정체는, '이상적이지만 계산 불가능한 NGD'라는 원본을 '계산 가능하지만 정보가 일부 손실된' 형태로 교묘하게 모사한 결과물이었던 것입니다. 마치 고가의 원본 회화를 저렴하지만 핵심 특징은 모두 담아낸 고품질 판화로 복제한 것과 같습니다. 이 판화가 너무나 성공적이어서 지난 10년간 원본의 존재를 잊게 만들었던 셈입니다.
흔한 오해들, 그리고 연구의 진짜 의미
이러한 분석은 몇 가지 흔한 오해를 바로잡고 연구의 진정한 가치를 명확히 하는 데 도움을 줍니다. 다만 연구는 정확히 읽어야 합니다. 이 연구가 모든 것을 해결하는 만병통치약은 아닙니다.
첫째, 'Adam이 NGD의 근사치라면, Adam은 NGD보다 항상 열등한가?'라는 오해입니다. 이론적으로는 그렇지만, 현실에서는 꼭 그렇지 않습니다. NGD는 이상적인 환경에서 최적이지만, 실제 딥러닝 학습 환경은 노이즈가 많고 복잡합니다. 이런 상황에서는 Adam의 '적당한' 근사가 오히려 더 빨리 좋은 해답을 찾는 '지름길'이 되기도 합니다. 모든 지형을 cm 단위로 측량하느라 시간을 보내는 것보다, 숙련된 등산객의 감으로 빠르게 길을 찾는 편이 효율적일 수 있는 것과 같은 이치입니다.
둘째, '이 연구 결과를 당장 적용하면 AI 성능이 비약적으로 향상되는가?'라는 성급한 기대입니다. 그렇지 않습니다. 이 연구는 새로운 옵티마이저를 발명한 것이 아니라, 기존 옵티마이저의 작동 원리를 규명한 기초 연구입니다. 이는 자동차 엔진의 연소 효율 공식을 발견한 것에 가깝습니다. 이 공식을 안다고 해서 당장 내 차의 연비가 좋아지지는 않습니다. 하지만 자동차 제조사들은 이 공식을 바탕으로 미래에 훨씬 더 효율적인 엔진을 설계할 수 있게 됩니다. 이 연구는 차세대 옵티마이저 개발을 위한 핵심적인 이론적 토대를 마련한 것입니다.
| 특성 | 자연 경사 하강법 (NGD) | Adam 최적화기 |
|---|---|---|
| 목표 | 정보 기하학적 최단 경로 탐색 | 빠르고 안정적인 손실 최소화 |
| 사용 정보 | 전체 파라미터 공간의 곡률 (피셔 정보 행렬) | 과거 기울기 정보의 지수 이동 평균 (1차, 2차 모멘트) |
| 계산 복잡도 | 극도로 높음 (모델 크기에 제곱 비례 이상) | 매우 낮음 (모델 크기에 선형 비례) |
| 실용성 | 대규모 모델에 거의 적용 불가 | 딥러닝 표준으로 널리 사용 |
| 비유 | 초고해상도 위성 지도를 실시간 분석하는 내비게이션 | 숙련된 운전자가 감과 경험으로 길을 찾는 방식 |
이론은 어떻게 돈이 되는가: 옵티마이저와 GPU 전쟁
이런 기초 이론 연구가 왜 중요할까요? 결국 돈과 직결되기 때문입니다. 챗GPT 같은 거대 언어 모델을 한 번 훈련하는 데에는 수십억, 수백억 원의 비용이 듭니다. 이 비용의 대부분은 모델을 연산하는 데 필요한 그래픽 처리 장치(GPU)를 빌리거나 구매하고, 막대한 전력을 소비하는 데서 발생합니다.
만약 새로운 옵티마이저를 개발해 훈련 효율을 10%만 높일 수 있다면, 이는 곧바로 수억 원의 비용 절감으로 이어집니다. 훈련 속도가 10% 빨라진다는 것은 새로운 모델을 시장에 더 빨리 출시할 수 있다는 의미이기도 합니다. AI 기술 경쟁에서 속도는 생명입니다.
AI의 발전은 흔히 더 큰 모델과 더 좋은 GPU의 역사로 알려져 있지만, 이는 절반의 진실입니다. 그 이면에는 Adam과 같은 알고리즘의 혁신이 있었습니다. 하드웨어의 발전이 자동차의 엔진 배기량을 키우는 것이라면, 옵티마이저의 발전은 연비를 높이고 변속을 부드럽게 하는 기술과 같습니다. 둘 중 하나만으로는 최고의 레이싱카를 만들 수 없습니다.
역사적으로 비슷한 사례를 찾자면 프로그래밍 언어의 '컴파일러(compiler)'를 들 수 있습니다. 초기 컴퓨터 프로그래머들은 기계가 직접 이해하는 저수준 언어로 코드를 작성해야 했습니다. 이는 극도로 어렵고 비효율적인 작업이었습니다. 이후 C언어 같은 고수준 언어와, 이를 기계어로 자동 번역 및 최적화해주는 컴파일러가 등장하면서 생산성은 폭발적으로 증가했습니다. 옵티마이저는 AI 모델 훈련 세계의 컴파일러와 같은 역할을 합니다. 더 좋은 옵티마이저는 더 적은 자원으로 더 뛰어난 AI를 더 빨리 만들 수 있게 해주는 핵심 기술입니다.
이 때문에 구글, 메타, 마이크로소프트 같은 빅테크 기업들은 옵티마이저 같은 기초 연구에 막대한 투자를 아끼지 않습니다. 이는 단순한 학문적 호기심이 아니라, 미래 기술 경쟁의 향방을 가를 전략적 투자입니다.
우리가 추적해야 할 신호: 데이터와 알고리즘 주권
이번 논의는 우리에게 더 묵직한 질문을 던집니다. 바로 '알고리즘 주권'의 문제입니다. 우리는 흔히 AI 시대의 경쟁력을 '데이터'에서 찾습니다. 누가 더 많고 좋은 데이터를 가졌는지가 중요하다고 말합니다. 물론 맞는 말입니다. 하지만 데이터가 전부가 아닙니다.
그 데이터를 가지고 얼마나 효율적으로 지능을 추출해낼 수 있는가, 즉 '알고리즘'의 효율성 또한 그에 못지않게 중요합니다. Adam은 다행히 오픈소스로 공개되어 누구나 자유롭게 사용할 수 있었습니다. 이는 AI 기술의 민주화에 크게 기여했습니다. 하지만 만약 미래에 어떤 기업이 Adam보다 2배 효율적인 차세대 옵티마이저를 독점적으로 개발하고 공개하지 않는다면 어떻게 될까요?
그 기업은 다른 경쟁사들보다 절반의 비용과 시간으로 더 뛰어난 AI를 만들 수 있게 됩니다. 이는 따라잡기 거의 불가능한 격차를 만듭니다. 기술의 종속은 바로 이런 지점에서 시작됩니다. 단순히 남들이 만든 모델을 가져다 쓰는 'API(응용 프로그램 프로그래밍 인터페이스, 특정 기능을 외부에서 쉽게 쓸 수 있게 만든 약속)' 경제에만 머물러서는 안 되는 이유입니다.
결국 중요한 것은 예언이 아니라 메커니즘입니다. 재현되는가, 그리고 그 조건은 무엇인가를 집요하게 파고들어야 합니다. Adam의 성공이 마법이 아니라 NGD라는 이상을 향한 정교한 근사였음을 이해하는 순간, 우리는 비로소 그 한계를 파악하고 다음 단계의 혁신을 스스로 설계할 수 있게 됩니다. 데이터 주권을 넘어, 핵심 알고리즘을 우리 손으로 만들고 개선할 수 있는 능력, 즉 '알고리즘 주권'을 확보하려는 노력이 필요한 시점입니다.
독자가 던질 법한 질문들
Q. 그래서 이 연구 때문에 제가 쓰는 AI 프로그램이 더 빨라지거나 좋아지는 건가요? A. 당장은 아닙니다. 이 연구는 자동차 엔진의 연소 원리를 더 깊이 이해한 것에 가깝습니다. 이 지식을 바탕으로 미래에 더 효율적인 엔진이 설계되겠지만, 지금 당장 도로 위를 달리는 차들이 바뀌는 것은 아닙니다. 다만, 2~3년 뒤에 나올 새로운 AI 모델들은 이 연구에서 얻은 통찰을 바탕으로 한, 더 개선된 최적화기를 탑재하고 나올 가능성이 높습니다.
Q. Adam 말고 다른 옵티마이저는 없나요? 왜 다들 Adam만 쓰는 건가요? A. 물론 다른 옵티마이저들도 많습니다. SGD with Momentum, RMSProp, AdaGrad 등 수많은 대안이 있고, 최근에는 Adam의 단점을 보완한 AdamW, RAdam, 혹은 완전히 새로운 접근법을 시도하는 옵티마이저들도 등장하고 있습니다. 그럼에도 Adam이 '국민조합'처럼 쓰이는 이유는 대부분의 문제에서 '그럭저럭' 좋은 성능을 '별다른 조정 없이' 내주기 때문입니다. 매우 안정적이고 사용하기 편한 '만능 공구' 같은 위치에 있습니다.
Q. 이 논문이 틀렸을 가능성은 없나요? 연구의 한계는 무엇입니까? A. 훌륭한 질문입니다. 모든 연구에는 한계가 따릅니다. 이 논문이 제시한 Adam의 수학적 모델은 여러 가정을 포함한 '근사치'입니다. 실제 수조 개 파라미터를 가진 거대 언어 모델의 복잡한 동역학을 완벽히 설명한다고 보기는 어렵습니다. 연구진도 선형 회귀 같은 비교적 단순한 모델에서 주로 검증했으며, 더 복잡한 모델에서의 일반화 가능성은 앞으로의 과제로 남겼습니다. 따라서 이 연구는 Adam을 이해하는 중요한 '지도'를 제시한 것이지, Adam의 모든 것을 담은 '실물'은 아닙니다. 재현성과 일반화 가능성은 계속해서 검증되어야 합니다.
이 브리핑이 유용했나요?
댓글 (0)
첫 댓글을 남겨주세요.