[论文解读] Improved Natural Language Generation via Loss Truncation
该论文提出损失截断(loss truncation)这一稳健训练方法,通过在训练过程中自适应地移除高损失样本,优化模型的可区分性,从而提升自然语言生成的忠实度与事实准确性。在摘要生成任务中,该方法在可区分性和事实准确性方面均优于标准对数损失基线模型。
Neural language models are usually trained to match the distributional properties of a large-scale corpus by minimizing the log loss. While straightforward to optimize, this approach forces the model to reproduce all variations in the dataset, including noisy and invalid references (e.g., misannotation and hallucinated facts). Worse, the commonly used log loss is overly sensitive to such phenomena and even a small fraction of noisy data can degrade performance. In this work, we show that the distinguishability of the models and reference serves as a principled and robust alternative for handling invalid references. To optimize distinguishability, we propose loss truncation, which adaptively removes high loss examples during training. We show this is as easy to optimize as log loss and tightly bounds distinguishability under noise. Empirically, we demonstrate that loss truncation outperforms existing baselines on distinguishability on a summarization task, and show that samples generated by the loss truncation model have factual accuracy ratings that exceed those of baselines and match human references.
研究动机与目标
- 解决标准对数损失训练在面对训练数据中噪声或无效参考文本时,神经语言模型的脆弱性问题。
- 开发一种可扩展、高效的对数损失替代方法,以提升模型的鲁棒性与生成质量。
- 优化模型生成文本与人类参考文本之间的可区分性,确保输出质量更高。
- 证明损失截断可在不依赖任务特定损失修改的前提下,提升摘要生成中的事实一致性。
提出的方法
- 损失截断通过在训练过程中自适应地移除高对数损失样本,对标准对数损失进行修改,从而有效过滤掉噪声或无效的参考文本。
- 该方法使用一个动态调整的截断阈值,基于训练批次中对数损失值的分布进行自适应调整。
- 它为可区分性提供了一个上界,确保模型输出与人类参考文本之间的差异性逐渐降低。
- 引入一种序列级别的拒绝采样方案,通过限制生成为高概率序列,进一步提升输出质量。
- 该方法与标准解码策略(如束搜索、top-k、top-p)兼容,可与现有解码器结合使用。
- 该方法计算效率高且可扩展,适用于大规模语言建模。
实验结果
研究问题
- RQ1修改后的训练目标能否提升神经语言模型对训练数据中噪声或无效参考文本的鲁棒性?
- RQ2与对数损失相比,优化可区分性是否能带来更高质量、更忠实的文本生成?
- RQ3对对数损失进行简单且可扩展的修改,能否实现与严谨可区分性优化相当的性能?
- RQ4与标准对数损失基线相比,损失截断是否能提升抽象摘要生成中的事实准确性?
主要发现
- 损失截断在HUSE得分(衡量可区分性的指标)上显著优于所有标准对数损失基线模型(包括束搜索、top-k、top-p及完整采样)。
- 采用损失截断训练的模型在摘要生成中的事实准确性超过所有基线模型,达到与人类参考文本相当的水平。
- 结合损失截断的拒绝采样进一步提升了输出质量,在事实一致性方面甚至超越了束搜索。
- 该方法对噪声参考文本具有鲁棒性,能有效降低幻觉或标注错误训练样本的影响。
- 损失截断为基于GAN的可区分性优化提供了一种实用且可扩展的替代方案,而后者在文本生成中极难训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。