Skip to main content
QUICK REVIEW

[论文解读] Forecasting Future World Events with Neural Networks

Andy Zou, Tristan Xiao|arXiv (Cornell University)|Jun 30, 2022
Computational and Text Analysis Methods被引用 6
一句话总结

本文提出了 Autocast,一个包含数千个来自专家锦标赛的真实世界预测问题的基准数据集,以及一个按日期组织的新闻语料库,用以模拟事件发生前的信息条件。尽管大模型和检索增强训练带来了性能提升,语言模型在判断性预测任务上仍显著落后于人类专家,二元预测的准确率仅为65%,而人类专家达到92%,凸显了自动化判断性预测的挑战。

ABSTRACT

Forecasting future world events is a challenging but valuable task. Forecasts of climate, geopolitical conflict, pandemics and economic indicators help shape policy and decision making. In these domains, the judgment of expert humans contributes to the best forecasts. Given advances in language modeling, can these forecasts be automated? To this end, we introduce Autocast, a dataset containing thousands of forecasting questions and an accompanying news corpus. Questions are taken from forecasting tournaments, ensuring high quality, real-world importance, and diversity. The news corpus is organized by date, allowing us to precisely simulate the conditions under which humans made past forecasts (avoiding leakage from the future). Motivated by the difficulty of forecasting numbers across orders of magnitude (e.g. global cases of COVID-19 in 2022), we also curate IntervalQA, a dataset of numerical questions and metrics for calibration. We test language models on our forecasting task and find that performance is far below a human expert baseline. However, performance improves with increased model size and incorporation of relevant information from the news corpus. In sum, Autocast poses a novel challenge for large language models and improved performance could bring large practical benefits.

研究动机与目标

  • 开发一个真实世界预测任务的基准,用于评估语言模型在判断性预测方面的能力,这是人工智能安全与决策制定中的关键挑战。
  • 解决当前缺乏对语言模型在需要对多样化、时效性信息进行推理的预测任务上进行严谨、数据驱动评估的问题。
  • 通过按日期组织新闻语料库,模拟真实世界的预测条件,防止未来信息泄露。
  • 探究语言模型是否能通过整合新闻信息并随时间推理,实现专家级预测。
  • 识别当前语言模型在预测方面的能力局限,特别是对罕见或高影响事件的预测能力,并评估过度依赖自动化预测的风险。

提出的方法

  • 整理 Autocast:一个包含1,000多个来自专家锦标赛的预测问题的数据集,涵盖政治、经济、科学与社会议题,答案格式多样。
  • 从 Common Crawl 构建一个按日期组织的新闻语料库,实现时间同步评估,确保模型仅能访问预测日期之前的新闻。
  • 训练语言模型在每个时间步仅使用过去可用的新闻生成预测,模拟实时预测过程。
  • 在推理过程中使用检索增强生成(RAG)技术,将相关新闻片段注入模型的上下文。
  • 使用准确率、校准度和与人类预测的相关性等标准指标评估模型性能。
  • 在多种问题类型和时间跨度下,将模型性能与强基准人类表现(预测者群体聚合)进行对比。

实验结果

研究问题

  • RQ1当在按日期组织的新闻语料库上进行训练时,大语言模型能否在真实世界、多样化且具有时效性的预测问题上达到人类水平的预测性能?
  • RQ2模型规模以及对相关新闻信息的访问程度在多大程度上影响预测准确率和校准度?
  • RQ3当前语言模型在多大程度上未能捕捉人类预测者所识别的关键考量因素,特别是在罕见或高影响事件中?
  • RQ4预测模型在数值预测任务上的表现如何,尤其是在涵盖多个数量级的指标上,如疫情病例数或经济指标?
  • RQ5过度依赖自动化预测系统存在哪些风险,特别是对尾部风险和决策延迟的影响?

主要发现

  • 最佳语言模型在二元预测任务上的准确率为65%,而人类专家基线为92%,表明存在显著的性能差距。
  • 模型性能随规模增大以及检索相关新闻而提升,表明信息获取能力和模型规模对预测至关重要。
  • 校准度较差,尤其是在极端概率值处,表明模型在不确定预测中高估了自身信心。
  • 即使是最先进的模型在涉及大数值范围的数值预测任务上表现欠佳,例如全球疫情病例数。
  • 该数据集表明,模型在应对‘未知的未知’——即人类预测者也未意识到的关键因素——方面存在困难,限制了其在系统性风险检测中的实用性。
  • 预测工具可能因自动化偏见和对低概率事件的误读,导致不作为或更激进的行为,从而增加系统性风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。