[论文解读] SciFact-Open: Towards open-domain scientific claim verification
本论文提出了 SciFact-Open,一个用于科学主张验证的新开放领域测试集,包含 279 个主张,其验证基于 50 万篇研究摘要。通过聚合四个最先进模型的预测结果,该测试集能够在真实世界场景中评估模型的泛化能力,揭示现有模型的性能至少下降 15 F1 分,凸显其在鲁棒性和泛化能力方面存在关键缺陷。
While research on scientific claim verification has led to the development of powerful systems that appear to approach human performance, these approaches have yet to be tested in a realistic setting against large corpora of scientific literature. Moving to this open-domain evaluation setting, however, poses unique challenges; in particular, it is infeasible to exhaustively annotate all evidence documents. In this work, we present SciFact-Open, a new test collection designed to evaluate the performance of scientific claim verification systems on a corpus of 500K research abstracts. Drawing upon pooling techniques from information retrieval, we collect evidence for scientific claims by pooling and annotating the top predictions of four state-of-the-art scientific claim verification models. We find that systems developed on smaller corpora struggle to generalize to SciFact-Open, exhibiting performance drops of at least 15 F1. In addition, analysis of the evidence in SciFact-Open reveals interesting phenomena likely to appear when claim verification systems are deployed in practice, e.g., cases where the evidence supports only a special case of the claim. Our dataset is available at https://github.com/dwadden/scifact-open.
研究动机与目标
- 在大规模科学文献的现实开放领域设置中,评估科学主张验证系统。
- 通过借鉴信息检索领域的聚合技术,解决在大规模语料库中进行详尽证据标注的不可行性。
- 识别并描述现实世界现象(如相互矛盾或不匹配的证据),这些现象对当前主张验证系统构成挑战。
- 提供一个基准,揭示现有模型在超出小型、精心筛选数据集后的局限性。
- 支持未来关于模型泛化、主张修订以及科学验证中证据摘要的研究。
提出的方法
- 通过聚合四个最先进科学主张验证模型对每个主张的前-k 个最自信预测,构建测试集。
- 使用单一检索系统从包含 50 万条句子的科学研究摘要语料库中识别候选摘要。
- 应用类似 TREC 的聚合策略选择证据候选,减少标注负担的同时保持覆盖范围。
- 由人工标注员对主张/摘要对(CAPs)进行标注,判断其为支持、反驳或信息不足(NEI)。
- 使用 F1 分数评估模型性能,基于摘要级别的标签,为提高效率而排除推理过程标注。
- 对聚合深度和系统数量进行敏感性分析,以验证测试集的稳健性。
实验结果
研究问题
- RQ1当在包含 50 万篇科学摘要的大规模开放领域语料库上评估时,最先进主张验证模型的表现如何?
- RQ2在开放领域设置中验证主张时,会涌现出哪些现实世界现象(如相互矛盾或不匹配的证据)?
- RQ3在小型、精心筛选的数据集(如 SciFact)上训练的模型,在更广泛的科学文献中泛化程度如何?
- RQ4该测试集对用于证据收集的模型数量和聚合深度的敏感性如何?
- RQ5该数据集能否揭示在小型基准中不明显的模型间有意义的性能差异?
主要发现
- 在原始 SciFact 数据集上训练的最先进模型,在 SciFact-Open 上评估时,F1 分数至少下降 15 分,表明其在开放领域设置中的泛化能力极差。
- 该数据集揭示了显著的现实世界现象,包括相互矛盾的证据,即多个摘要分别支持或反驳主张的不同方面。
- SciFact-Open 中的证据往往与主张的精确性不匹配,导致证据仅支持主张的特例。
- 聚合策略能有效捕捉相关证据,单一检索系统即可恢复大部分相关摘要,这一结论得到消融实验的证实。
- 该数据集包含证据数量高度不平衡的主张,表明某些主张远比其他主张更受研究关注,这可能影响模型评估。
- 作者发布了 91 个基于证据的主张修订,为未来关于细粒度主张修订和提升用户可解释性的研究提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。