[论文解读] KPI-EDGAR: A Novel Dataset and Accompanying Metric for Relation Extraction from Financial Documents
本文提出了 KPI-EDGAR,一个用于联合命名实体识别与关键绩效指标(KPI)关系抽取的新英文语料库,数据源自美国 EDGAR 数据库中手动标注的财务报告。该研究提出了一种加权 F1 指标,可考虑实体边界部分正确的情况——解决了 KPI 范围标注固有的模糊性问题——从而在这一噪声大、边界模糊的领域中,比传统 F1 指标更准确地评估模型性能。
We introduce KPI-EDGAR, a novel dataset for Joint Named Entity Recognition and Relation Extraction building on financial reports uploaded to the Electronic Data Gathering, Analysis, and Retrieval (EDGAR) system, where the main objective is to extract Key Performance Indicators (KPIs) from financial documents and link them to their numerical values and other attributes. We further provide four accompanying baselines for benchmarking potential future research. Additionally, we propose a new way of measuring the success of said extraction process by incorporating a word-level weighting scheme into the conventional F1 score to better model the inherently fuzzy borders of the entity pairs of a relation in this domain.
研究动机与目标
- 为解决公开可用、人工标注的联合 KPI 提取语料库在财务文档中的缺失,特别是在英文语境下的缺失。
- 克服传统 F1 分数在实体边界模糊或标注不一致时评估关系抽取的局限性。
- 通过发布高质量、公开可访问的数据集与评估指标,实现金融 NLP 领域可复现、可基准化的研究。
- 通过建模财务文本标注中的真实世界模糊性,支持更鲁棒的 KPI 提取模型开发。
- 通过基于真实企业年报的标准化基准与评估框架,促进未来金融 NLP 领域的研究。
提出的方法
- 从美国 EDGAR 数据库中获取的 10-K 年度报告构建 KPI-EDGAR,聚焦于上市公司。
- 在 1,000 多个句子中对 KPI、其数值(cy, py)及相关属性(如增加、减少、其相关者)进行人工标注。
- 设计了一种新颖的加权 F1 指标,基于预测与真实实体范围之间的词级重叠程度分配部分得分,而非要求完全匹配。
- 实现四种基线模型(包括 KPI-BERT),以展示该数据集与指标在基准测试中的实用性。
- 校准加权方案,以反映预测与真实实体范围之间的重叠程度,重叠段越长,权重越高。
- 通过比较基线预测结果在传统 F1 与加权 F1 指标下的表现,评估新指标的影响,突出部分正确的案例。
实验结果
研究问题
- RQ1如何从公开获取的财务报告中构建用于联合 KPI 提取的数据集,同时确保标注质量与一致性?
- RQ2人工标注者在 KPI 实体边界上的分歧程度如何?这种分歧对模型评估有何影响?
- RQ3在财务文本背景下,一种考虑实体范围部分重叠的加权 F1 指标,是否能比传统严格 F1 更好地反映模型性能?
- RQ4当使用传统 F1 与加权 F1 指标评估时,现有模型在新 KPI-EDGAR 数据集上的表现如何?
- RQ5模糊的实体边界对金融 NLP 任务中评估指标的设计有何影响?
主要发现
- KPI-EDGAR 数据集包含来自真实 10-K 报告的 1,000 多个标注句子,对 KPI、其数值(cy, py)及相关属性进行了详细标注。
- Cohen’s Kappa 分数显示标注者在 KPI 边界上存在显著分歧(kappa = 0.0822),表明实体范围定义存在高度模糊性。
- 所提出的加权 F1 指标成功捕捉了预测中的部分正确性,尤其在仅少数词语分类错误的情况下表现突出。
- 传统 F1 分数对边界的小错误惩罚过重,而加权 F1 提供了更细致、更真实的性能评估。
- 使用加权 F1 评估时,KPI-BERT 等基线模型展现出更合理的性能解读,揭示了其在部分预测中的潜在优势。
- 本研究证明,加权 F1 指标对标注噪声更具鲁棒性,且更真实地反映了金融 NLP 任务中模型在现实世界中的行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。