Skip to main content
QUICK REVIEW

[论文解读] QAInfomax: Learning Robust Question Answering System by Mutual Information Maximization

Yi‐Ting Yeh, Yun-Nung Chen|arXiv (Cornell University)|Aug 31, 2019
Topic Modeling参考文献 18被引用 7
一句话总结

本文提出 QAInfomax,一种基于互信息最大化正则化方法,通过鼓励模型学习更深层次、更具泛化能力的表征,提升问答系统的鲁棒性。通过使用改进的深度互信息最大化框架,最大化段落、问题和答案之间的互信息,QAInfomax 在无需额外训练数据的情况下显著提升了对抗性 Adversarial-SQuAD 基准上的性能,达到最先进水平。

ABSTRACT

Standard accuracy metrics indicate that modern reading comprehension systems have achieved strong performance in many question answering datasets. However, the extent these systems truly understand language remains unknown, and existing systems are not good at distinguishing distractor sentences, which look related but do not actually answer the question. To address this problem, we propose QAInfomax as a regularizer in reading comprehension systems by maximizing mutual information among passages, a question, and its answer. QAInfomax helps regularize the model to not simply learn the superficial correlation for answering questions. The experiments show that our proposed QAInfomax achieves the state-of-the-art performance on the benchmark Adversarial-SQuAD dataset.

研究动机与目标

  • 解决现代问答模型依赖训练数据中浅层相关性而非真正理解能力的局限性。
  • 提升模型对对抗性样本的鲁棒性,特别是对语义相关但与答案无关的干扰句。
  • 开发一种正则化方法,促使模型学习对有意义上下文敏感的表征,而非仅依赖词汇重叠。
  • 将基于深度互信息的互信息估计方法应用于自然语言处理领域,用于抽取式问答中的表征学习。

提出的方法

  • QAInfomax 使用基于深度互信息(DIM)框架的神经估计器,最大化段落、问题和答案之间的互信息(MI)。
  • 采用判别器网络区分正样本(联合分布)与负样本(边缘分布的乘积),并使用二元交叉熵损失实现稳定的互信息估计。
  • 该方法引入两项约束:局部一致性(LC),用于对齐答案表征与问题及段落表征;全局一致性(GC),用于对齐整体表征。
  • GC 组件使用汇总函数(如均值、最大值或采样)对表征进行池化,再计算互信息,从而增强对网络架构选择的鲁棒性。
  • 互信息估计采用改进的下界形式,结合正向与反向互信息项,提升实际性能表现。
  • 正则化项通过与标准交叉熵损失联合优化的方式集成到基于 BERT 的问答模型中,超参数经调优以确保训练稳定性和性能表现。

实验结果

研究问题

  • RQ1互信息最大化能否提升问答模型对对抗性干扰句的鲁棒性?
  • RQ2基于互信息的正则化是否有助于模型避免对训练数据中浅层词汇相关性的过拟合?
  • RQ3QAInfomax 与生成损失函数等现有方法相比,在对抗性基准上的泛化能力如何?
  • RQ4不同的互信息估计策略与汇总函数对模型性能和训练效率有何影响?

主要发现

  • QAInfomax 在 Adversarial-SQuAD 数据集上达到最先进性能,AddSent 指标 F1 得分为 54.5,AddOneSent 指标为 64.9,优于原始 BERT 及先前方法。
  • 在 AddSent 上表现显著提升(54.5 对比 BERT 的 51.0),表明对最坏情况对抗样本具有更强抵抗力。
  • 消融实验表明,局部一致性(LC)与全局一致性(GC)组件均不可或缺,任一移除均导致性能下降。
  • GC 中使用均值汇总函数表现最佳,但最大值与采样方法也表现良好,表明对架构选择具有鲁棒性。
  • 该方法在不损害标准 SQuAD 性能的前提下提升对抗鲁棒性,表明与标准训练目标兼容。
  • 由于 GC 的引入,训练速度下降 28%,但对抗鲁棒性的显著提升使该代价合理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。