[论文解读] Attention Temperature Matters in Abstractive Summarization Distillation
本文提出 Plate 方法,通过在教师模型中提高注意力温度以软化注意力分布,从而改进生成式摘要蒸馏,生成更简洁、更具生成性的伪标签。实验表明,该方法使学生模型生成的摘要更短、更具生成性,在 CNN/DM、XSum 和 NYT 三个摘要数据集上均持续优于基线伪标签方法。
Recent progress of abstractive text summarization largely relies on large pre-trained sequence-to-sequence Transformer models, which are computationally expensive. This paper aims to distill these large models into smaller ones for faster inference and minimal performance loss. Pseudo-labeling based methods are popular in sequence-to-sequence model distillation. In this paper, we find simply manipulating attention temperatures in Transformers can make pseudo labels easier to learn for student models. Our experiments on three summarization datasets show our proposed method consistently improves over vanilla pseudo-labeling based methods. We also find that both the pseudo labels and summaries produced by our students are shorter and more abstractive. Our code is available at \url{https://github.com/Shengqiang-Zhang/plate}.
研究动机与目标
- 为解决基线伪标签方法在蒸馏大规模生成式摘要模型时的局限性,即教师模型生成的摘要存在复制偏差和开头偏差。
- 降低教师模型注意力分布的过度自信,以避免为学生模型生成次优的伪标签。
- 通过更平滑的注意力机制生成更简洁、更多样化的摘要,从而提升蒸馏后学生模型的生成性质量。
- 探究教师模型中温度控制的注意力是否能在不微调学生模型的前提下提升蒸馏性能。
- 验证更软的注意力分布是否能带来更好的泛化能力,并促使学生模型表现出更强的生成性行为。
提出的方法
- 引入温度缩放因子 λ,重新缩放教师模型点积注意力机制中的 logits,以生成更软的注意力分布。
- 使用 λ > 1.0 的改进教师模型生成学生模型的伪标签,以更高温度的注意力替代标准注意力机制。
- 采用与基线伪标签相同的训练目标,但使用来自软化注意力教师模型生成的伪标签,从而实现更好的泛化能力。
- 将输入 token 位置归一化至 [0.0, 1.0],并分析文档分段中显著交叉注意力权重(≥0.15)的分布,以量化偏差减少程度。
- 评估温度对注意力熵的影响,并将其与预测熵及生成行为(复制 vs. 生成)进行相关性分析。
- 可视化交叉注意力权重,定性展示更高 λ 下复制偏差减少(注意力线更短)和开头偏差减少(注意力分布更广)的现象。
实验结果
研究问题
- RQ1在教师模型中提高注意力温度是否能减少生成伪标签中的复制偏差和开头偏差?
- RQ2教师模型中更软的注意力分布是否能促使学生模型生成更具有生成性且更简洁的摘要?
- RQ3温度缩放如何影响注意力和预测分布的熵?这种影响是否与生成行为相关?
- RQ4Plate 是否在多个生成式摘要基准上持续提升蒸馏性能?
- RQ5教师模型中更高温度的优势是否可推广至摘要以外的其他序列到序列任务?
主要发现
- Plate 在三个数据集(CNN/DailyMail、XSum、NYT)上均一致优于基线伪标签方法,ROUGE 分数显著提升,尤其在 ROUGE-L 上提升明显。
- 在 CNN/DailyMail 数据集上,使用 Plate 生成伪标签训练的学生模型 ROUGE-L 得分为 44.92,高于标准伪标签方法的 44.71。
- 来自高温度教师模型的伪标签中,有 56% 的 4-gram 来自源文本,而参考摘要中仅为 15%,表明复制偏差降低,抽象性提升。
- 显著交叉注意力权重(≥0.15)的分布从 λ=1.0 时的前 200 个词,移动至 λ=2.0 时的前 450 个词,表明开头偏差减少。
- 使用 Plate 训练的学生模型生成的摘要显著更具生成性且更简洁,具有更高比例的新 n-gram 和更低的复制率。
- 该方法具有泛化能力:在 WMT16 英德翻译任务中,Plate 的 BLEU 得分为 27.90,优于标准伪标签方法的 27.79。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。