Skip to main content
QUICK REVIEW

[论文解读] Contextual Sentence Classification: Detecting Sustainability Initiatives in Company Reports

Dan Hirlea, Christopher Bryant|arXiv (Cornell University)|Oct 7, 2021
Sentiment Analysis and Opinion Mining被引用 4
一句话总结

本文提出了一项新颖的任务,通过上下文句子分类检测公司报告中的可持续性举措。该方法提出一种基于RoBERTa的模型,结合多句上下文与CRF解码,以提升跨度级预测的一致性,在使用两句话上下文时,Exact Match的F1得分为49.16,显著优于二元分类方法,因其能更好地处理多句举措与标签一致性。

ABSTRACT

We introduce the novel task of detecting sustainability initiatives in company reports. Given a full report, the aim is to automatically identify mentions of practical activities that a company has performed in order to tackle specific societal issues. New methods for identifying continuous sentence spans need to be developed for capturing the multi-sentence structure of individual sustainability initiatives. We release a new dataset of company reports in which the text has been manually annotated with sustainability initiatives. We also evaluate different models for initiative detection, introducing a novel aggregation and evaluation methodology. Our proposed architecture uses sequences of consecutive sentences to account for contextual information when making classification decisions at the individual sentence level.

研究动机与目标

  • 为解决公司报告中可持续性举措常跨越多句话、需超越孤立句子分析的语义理解挑战。
  • 开发一种上下文句子分类框架,利用上下文句子提升举措跨度检测的准确率与一致性。
  • 发布一个全新的公开数据集,包含从45份公司报告中人工标注的192,978个句子,用于基准测试举措检测系统。
  • 评估上下文长度与标签一致性对模型性能的影响,特别是针对多句举措。
  • 探索自动化检测的可扩展性与局限性,尤其在处理主观或模糊案例(如单句举措)方面。

提出的方法

  • 模型使用RoBERTa联合编码连续多句序列,句间使用特殊分隔符以保留结构边界。
  • 为每个输入句子采用多头分类头,使模型在预测时能够关注上下文信息。
  • 应用条件随机场(CRF)对跨句子的IOBES标签进行预测,强化标签一致性并提升跨度边界检测效果。
  • 在标注数据集上端到端微调模型,将预测结果聚合为连续的举措跨度以供评估。
  • 在不同上下文窗口大小(每侧1句或2句)下评估模型架构,结果表明更大上下文可提升性能。
  • 提出一种新颖的评估方法,采用Min Match与Exact Match指标,评估预测举措跨度与标准标注的一致性。

实验结果

研究问题

  • RQ1与单句分类相比,引入多句上下文在检测可持续性举措方面有何改进?
  • RQ2通过CRF解码强制实现的标签一致性,在多大程度上提升了举措跨度预测的准确性?
  • RQ3检测可持续性举措的最佳上下文窗口大小是多少?其性能如何随训练数据规模变化?
  • RQ4在精确率、召回率与跨度级F1表现方面,二元分类与多分类IOBES标签方案有何差异?
  • RQ5更大的训练数据是否能提升模型泛化能力,并实现对更长上下文窗口的更好利用?

主要发现

  • 基于RoBERTa的模型在使用两句话上下文时,Exact Match指标的F1得分为49.16,显著高于单句上下文基线(46.84 F1)。
  • 采用IOBES标签与CRF解码后,预测一致性得到提升,与单句上下文基线相比,Exact Match F1提高了3.32分。
  • 模型在多句举措上的表现尤为优越,表明上下文感知建模对准确检测跨度至关重要。
  • 增加一个包含150万句的私有训练数据集后,模型性能得到提升,能够更有效地利用更长的上下文窗口,F1得分进一步提高。
  • 二元分类模型虽精确率更高,但召回率较低,且在预测多句举措时一致性较差,凸显细粒度标签的优势。
  • 定性分析显示,误报与漏报在单句举措中最为常见,表明其内在主观性与标注疲劳是主要挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。