Skip to main content
QUICK REVIEW

[论文解读] Modeling Precursors for Event Forecasting via Nested Multi-Instance Learning

Yue Ning, Sathappan Muthiah|arXiv (Cornell University)|Feb 25, 2016
Time Series Analysis and Forecasting参考文献 25被引用 5
一句话总结

本文提出了一种嵌套多实例学习(nMIL)框架,通过将每日新闻文章建模为嵌套的实例袋,从新闻流中预测社会抗议事件并识别前兆,实现最多提前5天的领先指标概率检测。该方法在预测准确性和前兆相关性方面优于基线多实例学习模型,尤其在识别拉丁美洲国家中多维度、随时间演变的前兆方面表现突出。

ABSTRACT

Forecasting events like civil unrest movements, disease outbreaks, financial market movements and government elections from open source indicators such as news feeds and social media streams is an important and challenging problem. From the perspective of human analysts and policy makers, forecasting algorithms need to provide supporting evidence and identify the causes related to the event of interest. We develop a novel multiple instance learning based approach that jointly tackles the problem of identifying evidence-based precursors and forecasts events into the future. Specifically, given a collection of streaming news articles from multiple sources we develop a nested multiple instance learning approach to forecast significant societal events across three countries in Latin America. Our algorithm is able to identify news articles considered as precursors for a protest. Our empirical evaluation shows the strengths of our proposed approaches in filtering candidate precursors, forecasting the occurrence of events with a lead time and predicting the characteristics of different events in comparison to several other formulations. We demonstrate through case studies the effectiveness of our proposed model in filtering the candidate precursors for inspection by a human analyst.

研究动机与目标

  • 开发一种方法,识别社会事件(如抗议)的基于证据的前兆,实现可解释的预测。
  • 解决仅使用群体层面标签(如抗议事件的发生)而无单篇新闻文章实例层面标签时,实现具有提前时间的事件预测挑战。
  • 通过引入两级嵌套多实例学习结构,对跨日新闻文章之间的时间依赖关系进行建模。
  • 将框架扩展至多类别事件分类,包括事件群体(如政府、工资、能源)的预测。
  • 在阿根廷、巴西和墨西哥的真实世界新闻数据上评估模型性能,展示其预测准确性和前兆可解释性。

提出的方法

  • 该模型将新闻数据组织为两级嵌套多实例学习框架:每日新闻文章构成第一级的‘袋’,而每日袋的序列构成第二级的‘超袋’。
  • 采用概率评分机制,估算每篇单篇新闻文章作为前兆的可能性,即使缺乏实例层面标签。
  • 通过惩罚函数和正则化强制实施时间约束,以促进跨日前兆检测的时序一致性。
  • 框架使用超袋损失函数,并引入权重参数β以平衡实例层面和袋层面的预测。
  • 采用合页损失阈值m₀和正则化参数λ,以控制模型敏感性和泛化能力。
  • 使用随机梯度下降端到端训练模型,以优化具有时间平滑性的嵌套多实例学习目标。

实验结果

研究问题

  • RQ1嵌套多实例学习框架能否有效从仅具有群体层面事件标签的未标注新闻文章中识别出社会抗议的前兆?
  • RQ2该模型在仅使用开源新闻数据的情况下,能否实现具有提前时间的抗议事件预测?
  • RQ3引入时间约束在多大程度上提升了前兆检测和预测准确性?
  • RQ4该模型能否在多个地理区域和事件类别(如政府、工资、能源)之间实现泛化?
  • RQ5该模型对超参数设置(如β和λ)的鲁棒性如何?

主要发现

  • 在阿根廷,nMIL模型在事件群体预测中实现了0.524的加权平均F1分数,相比rMIL avg基线提高了10.5%。
  • 在墨西哥,nMIL模型实现了0.575的加权平均F1分数,相比rMIL avg基线提高了10.6%。
  • 该模型成功检测到阿根廷和墨西哥抗议事件的前兆叙事,例如贫困加剧和43名失踪学生事件,其一致的概率信号在事件发生前10天内已显现。
  • 敏感性分析显示,测试准确率在β和λ的不同取值下保持稳定,表明对超参数设置具有鲁棒性。
  • 案例研究显示,该模型能有效过滤候选前兆,突出显示多维度、随时间演变的因素(如经济不满和司法裁决)作为领先指标。
  • 与标准多实例学习及基线模型相比,嵌套多实例学习框架显著提升了预测性能和前兆可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。