[论文解读] Probabilistic Assumptions Matter: Improved Models for Distantly-Supervised Document-Level Question Answering
本文通过分析概率空间、远程监督假设与优化/推理策略之间的相互作用,提出了一种统一的远程监督下文档级抽取式阅读理解框架。通过采用多目标损失联合多种概率建模范式,模型在 TriviaQA-Wiki 上将 F1 提升 4.3 分,在 NarrativeQA 摘要上将 Rouge-L 提升 1.7 分,达到当前最先进性能。
We address the problem of extractive question answering using document-level distant super-vision, pairing questions and relevant documents with answer strings. We compare previously used probability space and distant super-vision assumptions (assumptions on the correspondence between the weak answer string labels and possible answer mention spans). We show that these assumptions interact, and that different configurations provide complementary benefits. We demonstrate that a multi-objective model can efficiently combine the advantages of multiple assumptions and out-perform the best individual formulation. Our approach outperforms previous state-of-the-art models by 4.3 points in F1 on TriviaQA-Wiki and 1.7 points in Rouge-L on NarrativeQA summaries.
研究动机与目标
- 探究不同概率假设(特别是概率空间与远程监督解释方式)对文档级抽取式阅读理解模型性能的影响。
- 理解概率空间(段落级 vs. 文档级建模)、远程监督假设与优化/推理方法之间的相互作用。
- 识别在不同标签噪声水平(来自答案字符串集合)下,远程监督阅读理解的数据相关最优配置。
- 设计一种多目标学习框架,以高效整合多种概率建模范式的优点。
- 通过整合 SQuAD 2.0 的迁移学习,实现在 TriviaQA-Wiki 和 NarrativeQA 上的最先进性能。
提出的方法
- 形式化定义两种概率空间:段落级(H2-P),其中每个段落独立评分;文档级(H3-D),其中通过求和或取最大值操作聚合跨段落的答案跨度。
- 引入三种不同的远程监督假设:(1) 位置基于(H1-P),(2) 段落级跨度基于(H2-P),(3) 文档级(H3-D),每种将答案字符串映射到可能的提及跨度,具有不同的噪声特征。
- 采用基于 BERT 的联合问题-段落编码器对上下文和问题进行编码,随后使用定义的概率空间进行跨度评分。
- 提出一种多目标训练目标,联合优化多种建模范式(如 H2-P 和 H3-D),使模型能够受益于互补优势。
- 采用硬 EM 和最大边际似然进行优化,并在推理阶段评估 Viterbi 和边际推理策略。
- 应用来自 SQuAD 2.0 的迁移学习,进一步提升 TriviaQA-Wiki 和 NarrativeQA 上的性能。
实验结果
研究问题
- RQ1不同的概率空间建模范式(段落级 vs. 文档级)如何与远程监督假设在文档级阅读理解中相互作用?
- RQ2在不同概率假设下,答案字符串集合 $\mathcal{A}$ 的大小与质量变化对模型性能有何影响?
- RQ3多目标学习策略能否有效结合多种概率建模范式,从而超越单一配置的性能?
- RQ4优化与推理方法(如硬 EM 与最大边际似然、Viterbi 与边际推理)在不同数据分布下如何影响性能?
- RQ5从完全监督数据(SQuAD 2.0)进行迁移学习在多大程度上能提升远程监督下文档级阅读理解的性能?
主要发现
- 文档级概率空间(H3-D)显著优于段落级建模(H2-P),尤其在答案字符串集合较大或候选跨度较多的噪声子集上表现更优。
- H3-D 建模范式在 $\mathcal{Q}^{sl}$ 子集(1 个答案字符串,>5 个候选跨度)上将 F1 提升 2.9 分,在 $\mathcal{Q}^{ll}$ 子集(多个字符串,>5 个跨度)上提升 2.1 分,表明其对标签噪声具有更强鲁棒性。
- 结合 H2-P 与 H3-D 建模范式的多目标模型在 TriviaQA-Wiki 上实现 F1 提升 4.3 分,在 NarrativeQA 摘要上实现 Rouge-L 提升 1.7 分,优于此前最先进模型。
- 从 SQuAD 2.0 进行迁移学习进一步提升性能,最终在 TriviaQA-Wiki 上达到 76.3 的最先进 F1,在 NarrativeQA 摘要上达到 62.9 的最先进 F1。
- 性能提升在噪声更大的数据子集上最为显著,证实文档级建模对于处理大而模糊的答案字符串集合引入的混淆与虚假提及至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。