JIINSI
논문 브리핑

인공지능, 팬데믹 예측 정확도를 높이다: 캐나다 온타리오 COVID-19 사례 연구

한경모글 · 한경모
인공지능 모델이 과거 감염병 데이터를 분석하여 미래 발생률을 예측하는 그래프와 차트가 펼쳐진 컴퓨터 화면.
인공지능 모델이 과거 감염병 데이터를 분석하여 미래 발생률을 예측하는 그래프와 차트가 펼쳐진 컴퓨터 화면.
전 세계를 강타했던 COVID-19 팬데믹을 겪으면서, 공중 보건 예측의 중요성은 그 어느 때보다 부각되었습니다. 질병의 확산 양상을 정확하게 예측하는 능력은 정부가 적시에 정책을 수립하고, 의료 자원을 효율적으로 배분하며, 시민들에게 신뢰할 수 있는 정보를 제공하는 데 필수적이기 때문입니다. 하지만 실제 감시 데이터는 돌발적인 변화나 보고 오류, 혹은 일시적인 추세에 의해 쉽게 영향을 받아, 소음과 실제 변화를 구분하며 예측하는 것은 매우 어려운 과제였습니다. 이러한 난제를 해결하기 위한 해법으로 인공지능(AI)과 머신러닝(ML) 기술이 주목받고 있습니다. 최근 arXiv에 게재된 한 연구는 캐나다 온타리오 지역의 COVID-19 발병 사례 데이터를 활용해, 전통적인 통계 모델과 머신러닝 모델의 예측 성능을 비교 분석하여 공중 보건 예측의 새로운 가능성을 제시했습니다. 이 연구는 공중 보건 예측이 소음이나 일시적인 추세에 과도하게 반응하지 않으면서도, 감시 데이터의 급작스러운 변화에 즉각적으로 대응할 수 있어야 한다는 핵심 전제에서 출발합니다. 연구팀은 2020년 1월부터 2023년 10월까지의 온타리오 COVID-19 주간 확진자 수 데이터 190개를 사용했습니다. 그리고 예측 모델로는 자기회귀누적이동평균(ARIMA) 모델과 머신러닝 기반의 랜덤 포레스트(Random Forest), 그리고 익스트림 그래디언트 부스팅(XGBoost) 모델을 채택했습니다. 모델의 성능 평가와 튜닝 과정에서는 '롤링-오리진 시계열 교차 검증(rolling-origin time-series cross-validation)' 방식을 적용하여 시간 순서가 보존된 상태에서 모델의 실제 예측 능력을 검증했습니다. 이는 실제 상황처럼 시간이 흐름에 따라 새로운 데이터가 추가되는 환경을 모의하기 때문에 예측 모델의 실용성을 평가하는 데 매우 중요합니다. 주요 발견 사항은 다음과 같습니다.
  • 전통적인 ARIMA 모델은 안정적인 패턴을 예측하는 데 강점을 보였지만, 팬데믹과 같이 급변하는 상황에서는 적응력이 다소 떨어지는 한계를 보였습니다.
  • 랜덤 포레스트와 XGBoost와 같은 머신러닝 모델은 비선형적인 패턴과 급격한 변화를 더 잘 포착하는 능력을 보여주며, 예측 정확도에서 상당한 개선을 이끌어냈습니다.
  • 특히 이 연구는 단일 모델보다는 여러 모델의 예측 결과를 통합하는 '모델 평균화(Model Averaging)' 기법이 급변하는 공중 보건 상황에서 더욱 강력하고 안정적인 예측 성능을 제공할 수 있음을 시사했습니다.
일각에서는 머신러닝 모델이 ‘블랙박스’처럼 작동하여 예측 결과의 해석이 어렵다는 비판적인 시각도 존재합니다. 예측 과정이 투명하지 않으면 정책 결정자들이 모델의 권고를 신뢰하기 어렵다는 주장입니다. 그러나 이번 연구처럼 다양한 모델을 비교하고, 그 장단점을 파악하여 최종적으로 모델 평균화 방식을 채택하는 것은 이러한 불확실성을 상당 부분 해소할 수 있습니다. 또한 최근에는 설명 가능한 AI(Explainable AI, XAI) 연구가 활발히 진행되면서 머신러닝 모델의 의사결정 과정을 이해하려는 노력이 지속되고 있어, 이러한 단점은 점차 보완될 것으로 기대됩니다. 업계 전문가들은 이번 연구가 공중 보건 분야에서 AI의 활용 가능성을 다시 한번 입증한 사례로 평가하고 있습니다. 질병 관리청이나 보건 복지부와 같은 공공 기관들은 팬데믹 이후 AI 기반 예측 시스템 도입에 높은 관심을 보여왔습니다. 이러한 연구 결과는 단순히 COVID-19에 국한되지 않고, 향후 발생할 수 있는 독감, 신종 감염병, 혹은 특정 지역의 만성 질환 유병률 예측 등 다양한 공중 보건 시나리오에 적용될 수 있는 잠재력을 가지고 있습니다. 결론적으로, 이 연구는 인공지능과 머신러닝이 전통적인 통계 모델의 한계를 극복하고, 더욱 정확하고 유연한 공중 보건 예측 시스템을 구축하는 데 결정적인 역할을 할 수 있음을 보여주었습니다. 이는 미래의 건강 위기에 더욱 효과적으로 대비하고 대응하는 데 중요한 이정표가 될 것입니다.
인사이트

다양한 머신러닝 모델과 전통적인 통계 모델을 결합하는 '모델 평균화' 접근 방식은, 급변하는 공중 보건 데이터를 분석하여 팬데믹과 같은 상황에서 예측 정확도를 높이는 데 결정적인 역할을 합니다. 이는 미래 감염병 대응 전략 수립에 중요한 지침이 될 수 있습니다.

자주 묻는 질문

왜 공중 보건 예측에 머신러닝이 필요할까요?
공중 보건 데이터는 급작스러운 변화, 보고 오류, 일시적인 추세 등 예측하기 어려운 변동성이 큽니다. 머신러닝은 이러한 복잡하고 비선형적인 패턴을 전통적인 통계 모델보다 더 효과적으로 학습하고 예측하는 능력을 가지고 있기 때문입니다.
머신러닝 모델이 항상 기존 통계 모델보다 좋은 성능을 보이나요?
항상 그렇지는 않습니다. 전통적인 통계 모델(ARIMA)은 안정적이고 예측 가능한 패턴에는 여전히 강점을 가집니다. 이 연구처럼 머신러닝과 통계 모델의 장점을 결합한 '모델 평균화' 방식이 가장 강력하고 안정적인 예측 성능을 제공하는 경우가 많습니다.
이 연구 결과가 COVID-19 외 다른 질병 예측에도 적용될 수 있을까요?
네, 충분히 가능합니다. 이 연구에서 사용된 머신러닝 모델과 모델 평균화 기법은 일반적인 시계열 데이터 분석에 적용될 수 있습니다. 독감, 신종 감염병, 혹은 특정 지역의 만성 질환 유병률 예측 등 다양한 공중 보건 문제 해결에 활용될 잠재력을 가지고 있습니다.
공유XTelegram

이 기사 어땠어요?

피드백을 남겨주시면 더 나은 맞춤 추천을 만듭니다.

이런 뉴스를 매일 받아보세요

매일 아침 7시, 그날의 정리를 이메일과 Telegram으로 받아보세요.