[논문 리뷰] Large Language Model Prediction Capabilities: Evidence from a Real-World Forecasting Tournament
이 연구는 GPT-4의 예측 능력을 메타큘러스의 실제 세계 3개월 예측 대회에 참여시켜, 다양한 분야의 843개 이진 질문에 대한 확률 예측을 인간-집단 예측과 비교함으로써 평가한다. GPT-4는 중앙값 인간-집단 예측에 비해 유의미하게 열등했으며, 정확도는 50% 기준선과 구분되지 않아 고도로 발전한 아키텍처를 지녔음에도 실제 예측 능력은 제한적임을 시사한다.
Accurately predicting the future would be an important milestone in the capabilities of artificial intelligence. However, research on the ability of large language models to provide probabilistic predictions about future events remains nascent. To empirically test this ability, we enrolled OpenAI's state-of-the-art large language model, GPT-4, in a three-month forecasting tournament hosted on the Metaculus platform. The tournament, running from July to October 2023, attracted 843 participants and covered diverse topics including Big Tech, U.S. politics, viral outbreaks, and the Ukraine conflict. Focusing on binary forecasts, we show that GPT-4's probabilistic forecasts are significantly less accurate than the median human-crowd forecasts. We find that GPT-4's forecasts did not significantly differ from the no-information forecasting strategy of assigning a 50% probability to every question. We explore a potential explanation, that GPT-4 might be predisposed to predict probabilities close to the midpoint of the scale, but our data do not support this hypothesis. Overall, we find that GPT-4 significantly underperforms in real-world predictive tasks compared to median human-crowd forecasts. A potential explanation for this underperformance is that in real-world forecasting tournaments, the true answers are genuinely unknown at the time of prediction; unlike in other benchmark tasks like professional exams or time series forecasting, where strong performance may at least partly be due to the answers being memorized from the training data. This makes real-world forecasting tournaments an ideal environment for testing the generalized reasoning and prediction capabilities of artificial intelligence going forward.
연구 동기 및 목표
- GPT-4의 실제 세계 예측 능력을 진단하기 위해 진짜 답이 알려져 있지 않으며 학습 데이터에 포함되지 않은 맥락에서 평가하는 것.
- GPT-4가 확률 예측에서 인간-집단 예측의 중앙값 정확도를 뛰어넘거나 동등하게 유지할 수 있는지 테스트하는 것.
- GPT-4의 성능 저하가 중간 확률에 대한 편향 때문인지, 불확실성 하에서의 추론 능력의 근본적 한계 때문인지 조사하는 것.
- 훈련 데이터 암기와 독립적인 LLM의 일반화된 추론 및 예측 능력을 평가하기 위해 예측 대회를 강력한 벤치마크로 설정하는 것.
- 미래 AI 시스템에서 장기적 계획 수립과 목표 지향적 행동에 대한 AI 안전성에 미치는 영향을 탐색하는 것.
제안 방법
- 2023년 7월~10월 기간 동안 GPT-4는 메타큘러스 예측 플랫폼의 843개 이진 질문에 대해 확률 예측을 생성하도록 유도되었다.
- 예측 성능은 Brier 점수로 평가되었으며, 낮을수록 더 우수한 성능을 의미한다.
- 연구는 GPT-4의 평균 Brier 점수를 동일 대회에서의 인간 예측자의 중앙값 Brier 점수와 비교하였으며, 평균의 동등성을 검증하기 위해 사전 등록된 통계적 검정을 사용하였다.
- GPT-4의 예측이 50% 확률에 체계적으로 편향되어 있는지 여부를 검증하기 위해, 귀무가설이 50% 평균 예측일 경우의 일표본 t-검정을 실시하였다.
- 인간과 LLM 예측을 융합하기 위한 베이지안 모델 평균화 접근법을 제안하였지만, 본 연구에서는 구현하지 않았다.
- 연구는 분석 계획과 데이터 수집 절차를 오픈 사이언스 프레임워크에 사전 등록하여 투명성과 재현 가능성을 확보하였다.
실험 결과
연구 질문
- RQ1GPT-4의 확률 예측 성능은 실제 세계 대회 환경에서 인간-집단 예측의 중앙값과 유의미하게 다를까?
- RQ2GPT-4의 예측 정확도는 모든 질문에 대해 50% 확률을 할당하는 정보 없음 기준선보다 뚜렷이 열 劣할까?
- RQ3GPT-4는 50% 중간 확률에 체계적으로 편향되어 있는가? 이는 강한 신뢰도를 표현하지 못하는 능력 부족을 시사하는가?
- RQ4실제 세계 예측 대회가 훈련 데이터 암기와 독립적인 LLM의 일반화된 추론 및 예측 능력을 평가하기 위해 유효하고 탄탄한 벤치마크로 기능할 수 있는가?
- RQ5GPT-4의 열악한 예측 성능은 향후 AI 시스템에서 장기적 계획 수립 능력 개발에 어떤 영향을 미칠까?
주요 결과
- GPT-4의 평균 Brier 점수는 인간-집단 예측의 중앙값 Brier 점수보다 유의미하게 높아, 확률 예측 정확도가 열 劣함을 시사한다.
- GPT-4의 예측 정확도는 모든 질문에 대해 50% 확률을 할당하는 정보 없음 기준선과 유의미하게 다름이 없었다.
- GPT-4의 예측 분포가 50%에 유의미하게 중심을 두고 있다는 가설을 지지하는 데이터가 없었으며, 중간 확률에 대한 체계적 편향이 없음을 확인하였다.
- GPT-4는 빅테크, 미국 정치, 유행성 전염병, 우크라이나 전쟁 등 다양한 분야에서 인간-집단 예측의 중앙값을 유의미하게 빛나지 못했다.
- 연구는 진짜 답이 알려져 있지 않으며 학습 데이터에 포함되지 않은 맥락에서, 실제 세계 예측 대회가 LLM의 일반화 능력을 평가하는 데 유효하고 탄탄한 환경임을 확인하였다.
- 결과적으로 현재의 LLM, 예를 들어 GPT-4는 신뢰할 수 있는 미래 예측 능력을 지니지 못하며, 이는 AI 안전성과 미래 AI 시스템에서 장기적 목표 지향적 행동의 잠재적 가능성에 영향을 미친다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.