한경모의 논문 노트 · 2026-09-24
AI도 '인기 맛집'만 찾아다닙니다: 학계의 매튜 효과, 코드로 재현되다
인공지능이 인간처럼 인기 논문에만 쏠리는 현상이 실험으로 확인됐습니다. 이는 AI가 학문적 다양성을 해치고 기존 편향을 증폭시키는 '확성기'가 될 수 있다는 경고입니다.

“우리는 AI라는 거울을 통해 처음으로 우리 사회의 편향을 계량하고 증폭된 형태로 마주하게 된 것인지도 모릅니다. 중요한 것은 거울을 깨는 것이 아니라, 거울에 비친 우리 모습을 직시하는 것입니다.”
도입: AI가 논문을 읽는 시대, 무엇이 달라졌나
인공지능이 인간 연구자를 돕는 시대가 본격적으로 열리고 있습니다. 하루에도 수천 편씩 쏟아지는 논문을 단 몇 초 만에 요약하고, 관련 연구를 순식간에 찾아주는 AI 비서는 이제 현실입니다. 많은 이들이 기대했습니다. 인간의 편견과 제한된 집중력에서 벗어나, 오직 내용의 가치만으로 숨은 보석 같은 연구를 찾아내 줄 객관적인 심판관의 등장을 말입니다. AI라면 학연, 지연, 명성 같은 인간적인 배경 없이, 데이터 그 자체로만 판단할 것이라는 믿음이 있었습니다.
그런데 최근 이 믿음에 찬물을 끼얹는 연구 결과가 하나 나왔습니다. arXiv(주로 물리학, 수학, 컴퓨터 과학 분야의 논문이 정식 출판 전에 올라오는 웹사이트)에 공개된 한 논문은 AI 역시 인간처럼 '인기'에 쉽게 흔들린다는 사실을 보여줍니다. 논문 제목은 "인공지능 집단 내에서 사회적 영향과 과학적 관심의 배분"입니다. 제목은 다소 건조하지만, 내용은 우리에게 매우 중요한 질문을 던집니다. 과연 AI는 우리가 가진 편향을 교정하는 도구일까요, 아니면 그 편향을 전례 없는 속도와 규모로 증폭시키는 확성기가 될까요. 단순히 똑똑한 기계를 넘어, '현명한' 기계를 만드는 일이 왜 중요한지 이 연구는 명확히 보여주고 있습니다. 다만 연구는 정확히 읽어야 합니다. 이 현상의 작동 원리부터 차근차근 살펴보겠습니다.
'음원 차트'와 '논문 차트': 실험은 무엇을 보여주었나
이번 연구의 설계는 2006년 컬럼비아 대학교 연구팀이 진행했던 유명한 '뮤직 랩(Music Lab)' 실험을 떠올리게 합니다. 당시 연구팀은 가상의 음원 사이트를 만들어 참가자들이 무명 가수의 노래를 듣고 다운로드하게 했습니다. 한 그룹에는 아무 정보도 주지 않았고, 다른 그룹에는 다른 사람들이 얼마나 이 노래를 다운로드했는지 '인기 순위'를 보여주었습니다. 결과는 놀라웠습니다. 인기 순위를 본 그룹에서는 특정 노래 몇 곡에 다운로드가 집중되는 '쏠림 현상'이 극명하게 나타났습니다. 사람들은 노래 자체의 좋고 나쁨보다, 남들이 많이 듣는다는 사실에 더 큰 영향을 받은 것입니다. 한 번 인기를 얻은 노래는 계속 더 인기를 얻는, 일종의 자기실현적 예언이 된 셈입니다.
이번 AI 연구는 바로 이 설계를 학술 논문 세계로 가져왔습니다. 연구진은 1,000개의 인공지능 '에이전트'를 만들었습니다. 에이전트란 특정 목표를 위해 자율적으로 행동하도록 설계된 AI 프로그램으로, 여기서는 '좋은 논문을 선택하라'는 임무를 받았습니다. 이들에게 2015년 저명한 경제학 저널에 실린 실제 논문 114편의 제목과 초록을 보여주고 하나를 고르게 했습니다. 중요한 것은 여기서부터입니다. 인간 참가자에게 가짜 음원 순위를 보여줬듯, 연구진은 AI 에이전트에게 각 논문의 '가상 인용 횟수'와 '다운로드 수'를 함께 제시했습니다. 물론 이 숫자는 실제와 상관없이 연구진이 임의로 조작한 것입니다.
결과는 뮤직 랩 실험과 판박이였습니다. '이 논문은 인기가 많다'는 신호를 받은 논문에 AI 에이전트들이 압도적으로 몰렸습니다. 논문 제목이나 초록의 내용이 가진 본질적 가치와 무관하게, 단순히 인기가 많다는 외부 정보가 AI의 선택을 좌우한 것입니다. 이는 AI가 정보를 평가할 때, 내용의 질뿐만 아니라 '사회적 신호(social signal)'라고 불리는 집단적 평가 지표에 크게 의존한다는 점을 명백히 보여줍니다. 마치 우리가 식당을 고를 때 음식 맛에 대한 정보가 없으면 일단 줄이 길게 늘어선 집을 선택하는 것과 같은 이치입니다.
메커니즘 해부: 이것은 '군중심리'인가, '패턴 인식'인가
이 지점에서 중요한 질문이 나옵니다. AI가 정말 인간처럼 '군중심리'를 갖게 된 것일까요? 아니면 다른 이유가 있을까요? 재현되는가, 조건은 무엇인가. 메커니즘과 예언을 구분해야 합니다. 이 현상을 설명하는 두 가지 가설이 있습니다.
- '패턴 인식' 가설: 이쪽이 더 현실적인 설명입니다. 우리가 사용하는 대부분의 AI, 특히 LLM(거대 언어 모델, 즉 챗GPT처럼 사람의 말을 이해하고 생성하는 AI)은 인터넷의 방대한 텍스트 데이터를 학습합니다. 그 데이터 안에는 '인용 횟수가 높은 논문은 중요한 논문일 가능성이 높다'는 강력한 통계적 패턴이 존재합니다. AI는 이 패턴을 학습한 것입니다. 따라서 AI에게 '인용 횟수'라는 정보는 논문의 중요성을 판단하는 매우 강력한 '특성(feature)'으로 작용합니다. AI가 '남들을 따라 해야지'라고 의식적으로 생각하는 것이 아니라, '높은 인용 횟수라는 특성을 가진 선택지가 정답일 확률이 높다'고 기계적으로 계산한 결과라는 해석입니다.
- '군중심리' 가설: AI가 인간의 사회적 행동을 모방하는 수준에 이르렀다는 해석입니다. 이는 AI에게 의인화된 감정이나 의도를 부여하는 것으로, 아직 과학적으로 입증하기는 어렵습니다. AI는 감정을 느끼지 않습니다. 그저 데이터 속 패턴을 따를 뿐입니다.
저는 패턴 인식 가설이 이 현상을 더 정확히 설명한다고 봅니다. 하지만 중요한 점은, 그 메커니즘이 무엇이든 간에 결과적으로 '인간의 군중심리와 똑같은 효과'를 낳는다는 사실입니다. 마치 자율주행차가 도로의 파인 곳을 피하는 것을 학습할 때, 실제 구덩이를 인식해서 피하는 게 아니라 '그 지점에서 다른 차들이 모두 비켜 가더라'라는 데이터 패턴을 학습해 똑같이 핸들을 꺾는 것과 비슷합니다. 만약 도로가 보수되어 더 이상 구덩이가 없어져도, AI는 과거의 데이터 패턴에 따라 불필요한 회피 기동을 할 수 있습니다. 원인이 무엇이든 그 결과는 위험할 수 있습니다. AI의 논문 선택 문제도 마찬가지입니다. 그 동기가 무엇이든, 인기 있는 연구에만 관심이 쏠리는 결과는 학문 생태계 전체를 왜곡시킬 수 있습니다.
학계의 '매튜 효과': 부자는 더 부유해지고, 인기 논문은 더 인용된다
이러한 쏠림 현상은 사회학에서 오래전부터 알려진 '매튜 효과(Matthew Effect)'와 정확히 일치합니다. 사회학자 로버트 머튼이 이름 붙인 이 효과는 신약성서 마태복음의 '무릇 있는 자는 받아 풍족하게 되고 없는 자는 그 있는 것까지 빼앗기리라'라는 구절에서 유래했습니다. 쉽게 말해 '부익부 빈익빈' 현상입니다. 학계에서 매튜 효과는 이미 유명한 연구자나 명문 기관이 더 많은 연구비와 주목을 받고, 그 결과 더 많은 성과를 내어 격차를 벌리는 현상을 말합니다. 한 번 인용된 논문은 검색 결과 상단에 노출될 확률이 높아지고, 그로 인해 더 많은 연구자에게 읽혀 다시 인용되는 선순환(혹은 악순환) 고리에 들어갑니다.
문제는 AI가 이 매튜 효과를 전례 없는 규모와 속도로 증폭시킬 수 있다는 점입니다. 인간 연구자들의 관심이 쏠리는 데는 몇 년의 시간이 걸리지만, 수천, 수만 개의 AI 에이전트는 단 몇 시간 만에 특정 논문의 '인기 지수'를 극단적으로 부풀릴 수 있습니다. 이는 이제 막 싹을 틔우는 새로운 아이디어나 비주류 학설이 빛을 보기도 전에 묻혀버릴 위험을 만듭니다. 과학의 역사는 주류 패러다임에 도전하는 소수의 이단적인 아이디어들이 결국 혁신을 이끌어왔음을 보여줍니다. 코페르니쿠스의 지동설이나 아인슈타인의 상대성 이론도 처음에는 소수의 지지만을 받았습니다. 만약 당시의 학자들이 'AI 추천 시스템'에 의존했다면, 이 위대한 발견들은 더 늦어졌거나 영영 사장되었을지도 모릅니다.
AI의 개입이 가져올 변화를 인간 연구자의 세계와 비교하면 그 위험이 더 명확해집니다.
| 구분 | 인간 연구자 | AI 연구 보조 시스템 |
|---|---|---|
| 정보 처리 속도 | 느리고 제한적임 | 극도로 빠르며 대규모 처리가 가능함 |
| 편향의 원인 | 인지적 한계, 사회적 압력, 명성에 대한 선입견 | 학습 데이터의 통계적 패턴, 알고리즘 설계의 한계 |
| 파급 효과 | 점진적이며, 특정 학문 공동체 내에서 주로 발생 | 즉각적이며, 전 지구적 네트워크를 통해 전파됨 |
| 편향의 강화 | 동료 심사, 학회 등 사회적 과정을 통해 수년에 걸쳐 강화됨 | 알고리즘의 피드백 루프를 통해 기하급수적으로 증폭될 수 있음 |
흔한 오해와 정확한 해석: 두 가지 함정
이러한 AI의 편향 문제를 두고 흔히 나타나는 두 가지 오해가 있습니다. 이 함정들을 짚고 넘어가야 문제의 본질을 정확히 볼 수 있습니다.
- 오해 1: "더 똑똑한 AI를 만들면 해결될 문제다." 정확한 해석: 반드시 그렇지 않습니다. 문제의 핵심은 AI의 '지능' 수준이 아니라, 시스템의 '설계'와 '학습 데이터'에 있습니다. 이번 연구는 AI가 제목과 초록만 보는 제한된 조건에서조차 사회적 신호에 크게 흔들린다는 것을 보여줬습니다. 설령 AI가 논문 전체를 이해하는 더 높은 지능을 갖게 되더라도, 추천 알고리즘의 첫 단계에서 '인기 있는 논문'을 우선적으로 필터링한다면 편향은 이미 시스템에 내장된 것이나 다름없습니다. 이는 '쓰레기가 들어가면 쓰레기가 나온다(Garbage In, Garbage Out)'는 컴퓨터 과학의 오래된 격언을 떠올리게 합니다. 여기서는 '편향이 들어가면 편향이 나온다(Bias In, Bias Out)'고 말해야 할 것입니다. 해결책은 막연히 더 똑똑한 AI를 기다리는 것이 아니라, 의도적으로 다양성을 추구하도록 시스템을 설계하고, 편향되지 않은 양질의 데이터를 공급하는 것입니다.
- 오해 2: "이것은 학계에만 국한된 작은 문제다." 정확한 해석: 결코 그렇지 않습니다. 학술 논문 시장은 AI의 편향이 드러난 하나의 '실험실'에 불과합니다. 이 메커니즘은 우리 일상 곳곳에서 이미 작동하고 있습니다. 유튜브의 영상 추천, 넷플릭스의 영화 추천, 아마존의 상품 추천, 심지어 뉴스 포털의 기사 배열까지 모두 '인기'와 '사용자 반응'을 기반으로 한 알고리즘에 의해 움직입니다. 인기 있는 콘텐츠가 더 많이 노출되고, 더 많은 인기를 얻는 구조는 동일합니다. 이는 사회 전체를 거대한 '필터 버블' 안에 가두고, 정치적 양극화를 심화시키며, 상업적 유행을 인위적으로 만들어낼 수 있습니다. 학계에서 발견된 AI의 '인기 맛집 탐방' 성향은 사회 전반의 알고리즘 편향 문제를 비추는 축소판이자, 중요한 경고등입니다.
데이터 주권과 알고리즘 감사: 우리가 던져야 할 질문
결국 이 문제는 기술의 문제를 넘어 통제와 주권의 문제로 귀결됩니다. 우리가 사용하는 AI가 어떤 기준에 따라 정보를 걸러내고 우리에게 제시하는지, 그 결정 과정에 우리는 얼마나 개입할 수 있습니까? 이는 단순히 개인정보를 지키는 차원을 넘어, 우리의 생각과 판단을 형성하는 정보 환경의 주권을 누가 가질 것인가 하는 '데이터 주권(Data Sovereignty)'의 문제이기도 합니다.
따라서 우리는 기업들이 재무 감사를 받듯, 사회에 큰 영향을 미치는 AI 시스템에 대해 주기적으로 편향성과 공정성을 검증하는 '알고리즘 감사(Algorithmic Audit)' 제도의 도입을 진지하게 논의해야 합니다. AI가 특정 성별, 인종, 사회 계층에 불리한 결정을 내리지는 않는지, 학문적 다양성이나 소수 의견을 억압하지는 않는지 독립적인 기관이 검증하고 투명하게 공개해야 합니다. 이런 제도가 없다면 우리는 소수의 빅테크 기업이 설계한 '블랙박스' 알고리즘이 이끄는 대로 끌려갈 수밖에 없습니다.
앞으로 독자 여러분께서 이 문제의 향방을 추적하기 위해 주목해야 할 신호는 다음과 같습니다.
- AI 모델의 '영양성분표' 공개 의무화: 식품에 원산지와 영양성분이 표시되듯, AI 모델이 어떤 데이터로 학습했고 어떤 편향을 가질 수 있는지 명시하는 '모델 카드(Model Card)'나 '데이터 시트(Datasheets for Datasets)' 공개가 법제화되는지 지켜봐야 합니다.
- '다양성 지표'를 보상하는 시스템의 등장: 현재의 '좋아요'나 '클릭 수' 기반 추천 시스템을 넘어, 의도적으로 새롭거나 인기 없는 정보를 탐색하고 추천하는 AI에 가치를 부여하는 새로운 플랫폼이 등장하는지 주목할 필요가 있습니다.
- 제3자 AI 감사 기관의 설립: 정부나 비영리 단체를 중심으로 AI의 공정성과 안전성을 독립적으로 인증하는 기관이 설립되고, 이들의 인증이 사회적 신뢰의 기준으로 자리 잡는지 여부가 중요한 변곡점이 될 것입니다.
마무리: AI는 거울이다
이번 AI의 '인기 논문 편식' 연구는 AI 자체의 결함이라기보다, 우리 인간 사회가 가진 구조적 편향을 AI가 그대로 학습하고 증폭시킨 결과물로 보는 것이 더 정확합니다. AI는 우리 사회를 비추는 거울과 같습니다. 그 거울이 때로는 우리의 왜곡된 모습을 더 선명하고 거대하게 비춰주기도 합니다. 중요한 것은 그 모습이 보기 싫다고 거울을 깨뜨리거나 외면하는 것이 아닙니다.
오히려 우리는 AI라는 새로운 거울을 통해 인류 역사상 처음으로 우리 사회와 학문 공동체의 편향을 계량화된 데이터로 마주하게 된 것인지도 모릅니다. 이 선명한 반영을 통해 우리는 비로소 무엇이 잘못되었는지 직시하고, 교정을 시작할 기회를 얻었습니다. 결국 AI의 미래는 우리 손에 달려 있습니다. 편향을 증폭시키는 확성기로 만들 것인가, 아니면 편향을 깨닫게 하는 성찰의 도구로 삼을 것인가. 그 선택은 이제 시작되었습니다.
Q. AI가 인기 논문을 따라가는 게 꼭 나쁜가요? 인기 있는 데는 이유가 있을 텐데요. A. 일리가 있는 지적입니다. 인기는 종종 품질의 중요한 지표가 되기도 합니다. 문제는 '정도'와 '쏠림 현상'입니다. 모든 관심과 자원이 소수의 인기 논문에만 극단적으로 집중되면, 당장은 비주류처럼 보이지만 미래에 큰 파장을 일으킬 '될성부른 떡잎' 같은 연구들이 묻힐 수 있습니다. 이는 마치 모든 농부가 가장 잘 팔리는 단일 품종만 재배하는 것과 같습니다. 단기적으로는 수익이 극대화되겠지만, 새로운 병충해가 돌았을 때 생태계 전체가 붕괴할 위험에 처하게 됩니다. 효율성과 다양성 사이의 균형을 잃는 것이 가장 큰 위험입니다.
Q. 개인이 이런 AI의 편향에 어떻게 대응할 수 있나요? A. 좋은 질문입니다. 우선 AI의 추천을 맹신하지 않는 비판적 태도가 필요합니다. AI는 유용한 '조수'이지, 모든 것을 결정하는 '상사'가 아닙니다. AI가 추천한 정보의 출처를 확인하고, 때로는 의도적으로 AI의 추천 범위를 벗어나 다른 관점이나 비주류 정보를 직접 찾아보는 노력이 중요합니다. 예를 들어, AI 기반 뉴스 요약 서비스를 사용한다면, 가끔은 직접 여러 언론사 웹사이트를 방문해 같은 사안을 어떻게 다르게 보도하는지 비교해보는 식입니다. 도구의 노예가 아닌 주인으로서 AI를 활용하려는 의지가 필요합니다.
Q. 연구에서 사용된 AI 에이전트가 너무 단순한 것 아닌가요? GPT-4 같은 더 발전된 AI는 다를 수 있지 않을까요? A. 핵심을 짚으셨습니다. 다만 연구는 정확히 읽어야 합니다. 이 연구의 목적은 AI의 지능 수준을 측정하는 것이 아니라, '사회적 신호(인기 지표)'라는 특정 변수가 AI의 선택에 미치는 영향을 다른 변수와 분리해서 명확히 보려는 것입니다. 오히려 단순한 에이전트를 사용했기에 그 인과관계가 더 투명하게 드러났다고 볼 수 있습니다. 물론 GPT-4와 같은 LLM(거대 언어 모델)은 훨씬 더 복잡한 맥락을 이해할 수 있습니다. 하지만 이들 역시 방대한 인터넷 데이터를 통해 '인기 있는 것이 중요하다'는 통계적 패턴을 학습했기 때문에, 이 편향에서 완전히 자유롭다고 단언하기 어렵습니다. 문제의 본질은 AI의 지능 높낮이보다는, 그 AI를 움직이는 시스템의 설계와 학습 데이터의 편향성에 있습니다.
이 브리핑이 유용했나요?
댓글 (0)
첫 댓글을 남겨주세요.