Skip to main content
QUICK REVIEW

[논문 리뷰] Forecasting Future World Events with Neural Networks

Andy Zou, Tristan Xiao|arXiv (Cornell University)|2022. 06. 30.
Computational and Text Analysis Methods인용 수 6
한 줄 요약

이 논문은 전문가 토너먼트에서 유래한 수천 개의 실제 예측 질문과 일자별로 정리된 뉴스 코퍼스를 포함한 Autocast를 소개한다. 이는 경기 이전 정보 조건을 시뮬레이션하기 위한 것이다. 더 큰 모델과 검색 증강 학습을 통해 성능이 향상되었음에도 불구하고, 언어 모델은 여전히 인간 전문가에 비해 크게 뒤처지며, 바이너리 예측에서 65%의 정확도를 기록한 반면 인간 전문가는 92%의 정확도를 기록하여 판단 기반 예측 자동화의 과제를 드러낸다.

ABSTRACT

Forecasting future world events is a challenging but valuable task. Forecasts of climate, geopolitical conflict, pandemics and economic indicators help shape policy and decision making. In these domains, the judgment of expert humans contributes to the best forecasts. Given advances in language modeling, can these forecasts be automated? To this end, we introduce Autocast, a dataset containing thousands of forecasting questions and an accompanying news corpus. Questions are taken from forecasting tournaments, ensuring high quality, real-world importance, and diversity. The news corpus is organized by date, allowing us to precisely simulate the conditions under which humans made past forecasts (avoiding leakage from the future). Motivated by the difficulty of forecasting numbers across orders of magnitude (e.g. global cases of COVID-19 in 2022), we also curate IntervalQA, a dataset of numerical questions and metrics for calibration. We test language models on our forecasting task and find that performance is far below a human expert baseline. However, performance improves with increased model size and incorporation of relevant information from the news corpus. In sum, Autocast poses a novel challenge for large language models and improved performance could bring large practical benefits.

연구 동기 및 목표

  • 언어 모델이 판단 기반 예측 과제에서 실현 가능한 평가 벤치마크를 개발하는 것. 이는 인공지능 안전성과 의사결정 분야의 핵심 과제이다.
  • 다양하고 시간 민감도가 높은 정보를 바탕으로 한 추론이 필요한 예측 과제에 대해 LLM의 엄밀하고 데이터 기반의 평가가 부족한 문제를 해결하는 것.
  • 뉴스 코퍼스를 일자별로 정리하여 실제 예측 조건을 시뮬레이션하고, 미래 정보 泄露를 방지하는 것.
  • 언어 모델이 뉴스 정보를 통합하고 시간에 따라 추론함으로써 전문가 수준의 예측을 자동화할 수 있는지 탐구하는 것.
  • 현재 LLM의 예측 능력에 대한 한계, 특히 희귀하거나 영향력이 큰 사건에 대해 파악하고, 자동화된 예측에 대한 과도한 의존이 초래하는 위험을 평가하는 것.

제안 방법

  • 전문가 토너먼트에서 유래한 1,000개 이상의 예측 질문을 포함한 Autocast 데이터셋을 구축하며, 정치, 경제, 과학, 사회 분야를 포함하고 다양한 답변 형식을 수용한다.
  • Common Crawl에서 수집한 뉴스 코퍼스를 일자별로 정리하여, 모델이 예측 일자까지의 뉴스만 접근할 수 있도록 함으로써 시간에 동기화된 평가를 가능하게 한다.
  • 모델가 과거에 이용 가능한 뉴스만 사용하여 각 타임스텝에서 예측을 생성하도록 언어 모델을 훈련함으로써 실시간 예측을 시뮬레이션한다.
  • 추론 중에 관련 뉴스 스니펫을 모델의 컨텍스트에 삽입하기 위해 검색 증강 생성(RAG)을 사용한다.
  • 정확도, 校정성, 인간 예측과의 상관관계와 같은 표준 지표를 사용해 모델 성능을 평가한다.
  • 다양한 질문 유형과 시간 범위에서 인간 전문가 기반 기준(예측자 집단의 평균)과의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1큰 언어 모델이 일자별로 정리된 뉴스 코퍼스를 기반으로 훈련받을 경우, 실제 세계의 다양한 시간 민감도가 높은 질문에서 인간 수준의 예측 성능을 달성할 수 있는가?
  • RQ2모델 크기와 관련 뉴스 정보 접근성은 예측 정확도와 校정성에 어떤 영향을 미치는가?
  • RQ3현재 언어 모델이 인간 예측자가 식별하는 중요한 고려사항을 얼마나 잘 파악하지 못하는가? 특히 희귀하거나 영향력이 큰 사건에 대해 어느 정도의 실패를 보이는가?
  • RQ4수치 예측 과제, 예를 들어 패닉 대비 환자 수나 경제 지표 등 다양한 주요 척도에서 예측 성능은 어떻게 되는가?
  • RQ5특히 尾部 위험과 의사결정 지연과 관련하여 자동화된 예측 시스템에 과도하게 의존하는 위험은 무엇인가?

주요 결과

  • 최고의 언어 모델이 바이너리 예측 과제에서 65%의 정확도를 기록한 반면 인간 전문가 기준은 92%를 기록하여 뚜렷한 성능 격차가 있음을 시사한다.
  • 모델 성능은 크기가 커질수록 그리고 관련 뉴스를 검색할수록 향상되었으며, 이는 정보 접근성과 스케일이 예측에 있어 핵심 요소임을 보여준다.
  • 특히 극단적 확률 값에서 校정성이 열악하여, 모델이 불확실한 예측에 대해 과도하게 자신감을 갖는 경향이 있음을 나타낸다.
  • 최첨단 모델들조차도 패닉 대비 환자 수와 같은 큰 값 범위를 포함한 수치 예측 과제에서는 성능이 열악했다.
  • 이 데이터셋은 모델이 인간 예측자가 고려하지도 않은 '모르는 모르는 것들'(unknown unknowns)을 파악하지 못함을 드러내며, 체계적 위험 탐지에 있어 그 활용도가 제한됨을 보여준다.
  • 자동화된 예측 도구는 자동화 편향과 낮은 확률 사건의 오해로 인해 무작위 행동이나 더 위험한 행동을 유도할 수 있으며, 이는 체계적 위험을 증가시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.