Skip to main content
QUICK REVIEW

[论文解读] Attention-Guided Answer Distillation for Machine Reading Comprehension

Minghao Hu, Yuxing Peng|arXiv (Cornell University)|Aug 23, 2018
Topic Modeling参考文献 29被引用 14
一句话总结

本文提出了一种注意力引导的答案蒸馏方法,将集成机器阅读理解(MRC)模型压缩为单一高效的学生模型,同时提升鲁棒性。通过应用普通的知识蒸馏、答案蒸馏(以惩罚混淆答案)以及注意力蒸馏(以对齐注意力分布),学生模型实现了12倍的推理加速,SQuAD数据集上F1值仅下降0.4%,且在对抗性SQuAD和NarrativeQA基准上优于教师模型。

ABSTRACT

Despite that current reading comprehension systems have achieved significant advancements, their promising performances are often obtained at the cost of making an ensemble of numerous models. Besides, existing approaches are also vulnerable to adversarial attacks. This paper tackles these problems by leveraging knowledge distillation, which aims to transfer knowledge from an ensemble model to a single model. We first demonstrate that vanilla knowledge distillation applied to answer span prediction is effective for reading comprehension systems. We then propose two novel approaches that not only penalize the prediction on confusing answers but also guide the training with alignment information distilled from the ensemble. Experiments show that our best student model has only a slight drop of 0.4% F1 on the SQuAD test set compared to the ensemble teacher, while running 12x faster during inference. It even outperforms the teacher on adversarial SQuAD datasets and NarrativeQA benchmark.

研究动机与目标

  • 为解决当前最先进的MRC系统在依赖多个模型集成时存在的效率低下和易受对抗攻击的问题。
  • 研究知识蒸馏作为一种方法,将集成模型压缩为单一、高效且鲁棒的学生模型。
  • 缓解偏置蒸馏问题,即教师模型在混淆答案上过度自信的预测会误导学生模型。
  • 通过不仅转移输出分布,还转移基于注意力的对齐模式和对干扰项敏感的监督信号,提升学生模型的泛化能力和鲁棒性。

提出的方法

  • 通过最小化集成教师模型与单一学生模型之间答案跨度的软标签分布之间的交叉熵,应用普通的知识蒸馏。
  • 引入答案蒸馏,基于教师模型对最强干扰项的预测,使用边缘损失惩罚学生模型在最混淆答案跨度上的预测。
  • 提出注意力蒸馏,通过均方误差匹配教师与学生模型之间的注意力分布,提升对齐效果和可解释性。
  • 利用集成模型的注意力图和答案边界概率引导学生模型的训练,同时提升效率和鲁棒性。
  • 将三种蒸馏组件——输出蒸馏、答案蒸馏和注意力蒸馏——整合为统一的训练目标。
  • 端到端训练学生模型,使用交叉熵损失(用于答案跨度)、边缘损失(用于混淆答案)和均方误差损失(用于注意力对齐)的加权组合。

实验结果

研究问题

  • RQ1知识蒸馏能否有效将集成MRC模型压缩为单一模型,同时保持性能?
  • RQ2在蒸馏过程中,如何缓解教师模型对语义矛盾干扰项过度自信预测所导致的偏置蒸馏问题?
  • RQ3注意力蒸馏能否通过从教师模型转移对齐模式来提升学生模型的泛化能力?
  • RQ4蒸馏是否能提升对对抗性样本的鲁棒性,特别是在分布外设置下?
  • RQ5单一蒸馏模型能否在效率和鲁棒性方面均超越原始的集成教师模型?

主要发现

  • 最佳学生模型在SQuAD测试集上的F1值仅比集成教师模型低0.4%,但推理速度提升了12倍。
  • 蒸馏后的学生模型在对抗性SQuAD数据集上的表现优于教师模型,表明其对对抗性样本具有更强的鲁棒性。
  • 在NarrativeQA基准上,学生模型的Bleu-1得分超过教师模型,表明其在开放域问题上的生成质量更优。
  • 答案蒸馏有效降低了学生模型对混淆答案跨度的置信度,防止因教师信号的偏置导致过度自信的错误预测。
  • 注意力蒸馏提升了学生模型对问题与篇章标记对齐的能力,使其注意力模式更加精确且可解释。
  • 三种蒸馏组件的结合实现了最佳整体性能,表明来自输出、混淆答案和注意力的互补监督能有效增强模型泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。