[论文解读] A Discrete Hard EM Approach for Weakly Supervised Question Answering
本文提出了一种用于弱监督阅读理解的离散硬期望最大化(hard EM)方法,将预先计算的可能解集(例如答案片段或公式)视为离散隐变量。通过迭代预测最可能的解并更新模型参数以强化该解,该方法在六个问答任务上实现了最先进性能,相较于先前方法绝对提升2%–10%,尤其在解集较大且含噪声时表现更优。
Many question answering (QA) tasks only provide weak supervision for how the answer should be computed. For example, TriviaQA answers are entities that can be mentioned multiple times in supporting documents, while DROP answers can be computed by deriving many different equations from numbers in the reference text. In this paper, we show it is possible to convert such tasks into discrete latent variable learning problems with a precomputed, task-specific set of possible "solutions" (e.g. different mentions or equations) that contains one correct option. We then develop a hard EM learning scheme that computes gradients relative to the most likely solution at each update. Despite its simplicity, we show that this approach significantly outperforms previous methods on six QA tasks, including absolute gains of 2--10%, and achieves the state-of-the-art on five of them. Using hard updates instead of maximizing marginal likelihood is key to these results as it encourages the model to find the one correct answer, which we show through detailed qualitative analysis.
研究动机与目标
- 为解决弱监督阅读理解中的学习挑战,即仅提供答案文本而无关于如何推导答案的显式监督信号。
- 提升在存在多个虚假推导路径(如多个答案提及或公式)可产生正确答案的任务上的模型性能。
- 开发一种训练方法,能够更好识别众多合理候选解中的唯一正确解,而非最大化所有选项的边缘似然。
- 证明硬期望最大化更新——在每一步聚焦于最可能的解——相比软或边缘似然方法,能为真实解提供更强的归纳偏置。
提出的方法
- 将可能的答案推导集合(如文档中的片段或由数字生成的公式)视为预计算的离散隐变量 Z,每个样本均预先计算。
- 使用模型基于当前参数预测每一步训练中最可能的解 z ∈ Z。
- 通过硬期望最大化风格的更新,仅聚焦于最可能解,最大化其似然性,从而更新模型参数。
- 在预测(E步)与参数更新(M步)之间迭代进行,直至收敛,使模型逐渐提高对正确解的概率分配。
- 将该方法应用于多种问答任务,包括多提及阅读理解、离散推理(DROP)和语义解析(WikiSQL),并采用 BERT 等强大模型架构。
- 通过在噪声较大的 Z 集上测试(如通过 ROUGE-L 阈值筛选),确保方法鲁棒性,结果表明该方法对虚假解的敏感度低于基于最大边缘似然(MML)的基线方法。
实验结果
研究问题
- RQ1是否可通过预计算解集的离散隐变量建模,提升弱监督问答任务的学习效果?
- RQ2聚焦于每一步更新中最可能解的硬期望最大化方法,是否优于基于边缘似然最大化的基线方法,以识别正确答案?
- RQ3当解集 Z 包含大量虚假选项时(如在 DROP 和 WikiSQL 等任务中),该方法表现如何?
- RQ4当 Z 集通过启发式方法(如 ROUGE-L)构建时,该方法对预计算解集中的噪声是否具有鲁棒性?
- RQ5模型在多大程度上学会为正确解分配高概率?与基于 MML 的训练相比,其表现如何?
主要发现
- 所提出的硬 EM 方法在六个多样化的问答任务(包括 TriviaQA、NarrativeQA、DROP 和 WikiSQL)上,相较于先前方法实现了 2%–10% 的绝对性能提升。
- 在 WikiSQL 上,该方法比近期基于奖励的语义解析最先进模型高出 13% 的绝对百分点,证明其在复杂推理任务中的有效性。
- 当 |Z| > 3 时,该方法尤为有效,且随着解集规模增大,与 MML 方法的性能差距进一步扩大,表明其对歧义的处理能力更强。
- 定性分析显示,模型逐步学会为正确解分配更高概率,在 NarrativeQA 上 98% 的正确预测和在 DROP ${}_{\text{num}}$ 上 92% 的正确预测均生成了正确解。
- 该模型对 Z 中的噪声具有鲁棒性:当 Z 大小从 4.3 增加到 7.1(通过更宽松的 ROUGE-L 阈值),MML 性能下降 4.93 分,而硬 EM 方法仅下降 0.80 分。
- 模型偶尔会做出错误预测(如在 DROP 上偏好 '37-36' 而非 '40-36'),但能自我恢复并纠正,表现出与硬 EM 一致的动态学习行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。