[論文レビュー] Large Language Model Prediction Capabilities: Evidence from a Real-World Forecasting Tournament
本研究では、GPT-4の予測能力を、Metaculusで実施された3か月間の予測コンペティションに参加させることで評価した。843個のバイナリーカテゴリの質問について、多様な分野にわたる確率的予測を人間の集団予測と比較した。GPT-4は中央値の人間集団予測よりも著しく劣り、正確性は50%のベースラインと区別できない結果となり、優れたアーキテクチャを有するものの、現実世界における予測能力に限界があることが示された。
Accurately predicting the future would be an important milestone in the capabilities of artificial intelligence. However, research on the ability of large language models to provide probabilistic predictions about future events remains nascent. To empirically test this ability, we enrolled OpenAI's state-of-the-art large language model, GPT-4, in a three-month forecasting tournament hosted on the Metaculus platform. The tournament, running from July to October 2023, attracted 843 participants and covered diverse topics including Big Tech, U.S. politics, viral outbreaks, and the Ukraine conflict. Focusing on binary forecasts, we show that GPT-4's probabilistic forecasts are significantly less accurate than the median human-crowd forecasts. We find that GPT-4's forecasts did not significantly differ from the no-information forecasting strategy of assigning a 50% probability to every question. We explore a potential explanation, that GPT-4 might be predisposed to predict probabilities close to the midpoint of the scale, but our data do not support this hypothesis. Overall, we find that GPT-4 significantly underperforms in real-world predictive tasks compared to median human-crowd forecasts. A potential explanation for this underperformance is that in real-world forecasting tournaments, the true answers are genuinely unknown at the time of prediction; unlike in other benchmark tasks like professional exams or time series forecasting, where strong performance may at least partly be due to the answers being memorized from the training data. This makes real-world forecasting tournaments an ideal environment for testing the generalized reasoning and prediction capabilities of artificial intelligence going forward.
研究の動機と目的
- 真の答えが未知であり、トレーニングデータに含まれない文脈において、GPT-4の現実世界における予測能力を評価すること。
- GPT-4が確率的予測において、人間集団予測の中央値の正確性を上回るか、同等に達するかをテストすること。
- GPT-4の予測が、中間確率(50%付近)へのバイアスに起因するのか、それとも不確実性下での推論における根本的制限に起因するのかを調査すること。
- トレーニングデータの記憶に依存しない、一般化された推論と予測の評価のための予測コンペティションを、強固なベンチマークとして確立すること。
- 今後のAIシステムにおける長期的計画および目的指向行動に関するAIセーフティへの影響を検討すること。
提案手法
- GPT-4は、2023年7月から10月までの3か月間にわたり、Metaculusの予測プラットフォームから抽出された843個のバイナリーフォーマットの質問について、確率的予測を生成するようにプロンプトされた。
- 予測のスコアリングには、確率的正確性を評価する標準的な指標であるBrierスコアが用いられ、低いスコアがより優れた性能を示す。
- 本研究では、GPT-4の平均Brierスコアを、同じコンペティションに参加した人間予測者の中央値Brierスコアと比較した。平均の等価性を検証するため、事前に登録された統計的仮説検定が用いられた。
- GPT-4の予測が50%の確率に系統的に偏っているかどうかを検証するため、帰無仮説として「平均予測確率が50%である」とする一標本t検定が実施された。
- 人間とLLMの予測を統合するためのベイジアンモデル平均法が提案されたが、本研究では実装されていない。
- 本研究では、分析計画およびデータ収集手順をオープンサイエンスフレームワークに事前に登録することで、透明性と再現性を確保した。
実験結果
リサーチクエスチョン
- RQ1GPT-4の確率的予測パフォーマンスは、実世界のコンペティション環境において、人間集団の中央値予測と著しく異なるか?
- RQ2GPT-4の予測正確性は、すべての質問に50%の確率を割り当てる情報なしベースラインよりも著しく悪いのか?
- RQ3GPT-4は、50%の中央付近の確率に系統的なバイアスを示しており、強い自信を表現できないのか?
- RQ4実世界の予測コンペティションは、記憶の影響を除いたLLMの一般化された推論と予測を評価する有効なベンチマークとして適しているか?
- RQ5GPT-4の弱い予測パフォーマンスは、将来のAIシステムにおける長期的計画能力の開発にどのような影響を及えるのか?
主な発見
- GPT-4の平均Brierスコアは、人間集団の中央値Brierスコアよりも顕著に高く、確率的正確性が劣っていることを示した。
- GPT-4の予測正確性は、すべての質問に50%の確率を割り当てる情報なしベースラインと有意に差がなかった。
- GPT-4の予測分布が50%に顕著に集中しているという仮説は、データによって支持されず、50%の平均予測に偏っているとは言えなかった。
- GPT-4は、大手テック企業、米国政治、感染症の流行、ウクライナ情勢など、多様な分野において、人間集団の中央値予測を著しく下回った。
- 本研究では、真の答えが未知であり、トレーニングデータに含まれない環境において、実世界の予測コンペティションがLLMの一般化能力をテストする有効で強固な環境であることが確認された。
- 研究結果から、現在のLLM(GPT-4など)は信頼できる予測能力に欠けていることが示され、AIセーフティおよび将来のAIシステムにおける長期的目標指向行動の可能性に影響を及えるものである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。