[논문 리뷰] Approaching Human-Level Forecasting with Language Models
최근 조회-강화된 언어 모델 시스템을 구축하여 이진 이벤트를 예측하고, 최신 뉴스를 조회하고 scratchpad 프롬프트로 추론하며 예측을 앙상블함으로써 대중과의 성능에 거의 근접하고, 일부 설정에서는 이를 능가한다.
Forecasting future events is important for policy and decision making. In this work, we study whether language models (LMs) can forecast at the level of competitive human forecasters. Towards this goal, we develop a retrieval-augmented LM system designed to automatically search for relevant information, generate forecasts, and aggregate predictions. To facilitate our study, we collect a large dataset of questions from competitive forecasting platforms. Under a test set published after the knowledge cut-offs of our LMs, we evaluate the end-to-end performance of our system against the aggregates of human forecasts. On average, the system nears the crowd aggregate of competitive forecasters, and in some settings surpasses it. Our work suggests that using LMs to forecast the future could provide accurate predictions at scale and help to inform institutional decision making.
연구 동기 및 목표
- 이진 이벤트 예측에서 인간 예측자와 일치하도록 자동 예측의 동기를 부여한다.
- 업데이트된 정보를 반영하기 위해 조회-강화 프롬프트를 활용한다.
- 예측 추론을 개선하기 위한 자기지도 미세 조정 방식은 개발한다.
- 최근의 대규모 데이터셋에서 군중 집계와 비교한 엔드투엔드 예측을 평가한다.
제안 방법
- 쿼리 생성, 관련성 랭킹, 기사 요약을 포함하는 조회-강화 LM 파이프라인을 구축한다.
- 질문 맥락과 기사 요약에서 예측을 생성하는 추론 모듈을 신중하게 설계된 scratchpad 프롬프트를 통해 사용한다.
- 모델 출력이 군중을 능가하는 자기지도 데이터에서 모델을 미세 조정하여 추론을 개선한다.
- 정규화된 평균(trimmed mean)을 사용하여 여러 예측을 앙상블하고 최종 예측을 산출한다.
- 군중 집계와 비교하여 Brier 점수 및 보정 지표로 엔드투엔드 시스템을 평가한다.
- 검색, 프롬프트, 앙상블 전략을 최적화하기 위한 하이퍼파라미터 스윕.

실험 결과
연구 질문
- RQ1조회-강화 LM 시스템이 인간 군중의 성능에 근접하거나 이를 능가하는 이진 이벤트를 예측할 수 있는가?
- RQ2검색 품질, 추론 프롬프트, 앙상블이 예측 정확도와 보정에 어떤 영향을 미치는가?
- RQ3추론의 자기지도 미세 조정이 제로샷 기준선에 비해 예측 성능을 향상시키는가?
- RQ4선별적 설정 및 조건이 있는 설정에서 시스템이 인간 군중보다 나은 성능을 보이는가?
주요 결과
- 엔드투엔드 시스템은 모든 질문에서 군중에 근접한 성능을 보이며, Brier 점수는 0.179로 군중의 0.149(테스트 집합의 평균) 대비 낮다.
- 집계 정확도에서 시스템은 모든 질문에 대해 71.5%를 달성했고 군중은 77.0%였다.
- 선별 설정과 충분한 관련 기사에서 시스템은 일부 지표에서 군중 집계를 능가할 수 있다.
- 시스템은 잘 보정되며 RMS 보정은 군중과 비슷하고 제로샷 설정에서 기본 모델보다 개선된다.
- 적어도 5개의 관련 기사 검색과 조기 검색 날짜는 군중에 비해 성능을 향상시킨다.
- 예측이 군중을 이기는 데이터에서 추론 LM을 미세 조정하면 더 강력한 예측 능력이 얻어진다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.