[论文解读] Wat zei je? Detecting Out-of-Distribution Translations with Variational Transformers
本文提出 BLEUVar,一种用于神经机器翻译(NMT)的新颖不确定性度量方法,通过在 Transformer 模型中使用带 dropout 的变分推断来检测分布外(OOD)输入。通过估计在多次采样翻译中的预测方差以获得认知不确定性,BLEUVar 能够有效识别出使用德语词汇特征的荷兰语句子作为 OOD 输入,在 WMT13 和 Europarl 数据集上表现出高检测性能。
We detect out-of-training-distribution sentences in Neural Machine Translation using the Bayesian Deep Learning equivalent of Transformer models. For this we develop a new measure of uncertainty designed specifically for long sequences of discrete random variables -- i.e. words in the output sentence. Our new measure of uncertainty solves a major intractability in the naive application of existing approaches on long sentences. We use our new measure on a Transformer model trained with dropout approximate inference. On the task of German-English translation using WMT13 and Europarl, we show that with dropout uncertainty our measure is able to identify when Dutch source sentences, sentences which use the same word types as German, are given to the model instead of German.
研究动机与目标
- 为解决当前最先进的 NMT 模型中缺乏不确定性估计的问题,特别是针对检测分布外(OOD)输入。
- 开发一种适用于长序列离散输出(如翻译句子)的可扩展不确定性度量方法。
- 通过识别低置信度、可能出错的翻译以实现 NMT 中的选择性分类,供人工审查。
- 评估模型不确定性是否与翻译质量及 OOD 检测性能相关。
- 将计算机视觉中的贝叶斯深度学习工具扩展至自然语言处理领域,特别是序列建模在翻译中的应用。
提出的方法
- 提出 BLEUVar,一种基于在解码过程中多次随机前向传播所计算的 BLEU 分数方差的新颖不确定性度量方法。
- 在 Transformer 模型中应用 dropout 近似推断,以对同一输入生成多样化且不确定的预测结果。
- 在推理过程中对模型权重进行蒙特卡洛采样,以估计输出序列上的预测不确定性。
- 采用变分推断近似真实模型权重后验分布,实现在无需完整贝叶斯训练的前提下进行不确定性量化。
- 结合预测采样与 BLEU 分数聚合,构建一种可微的、序列级别的不确定性代理指标。
- 训练标准 Transformer 模型并使用其预测方差作为认知不确定性的代理指标。
实验结果
研究问题
- RQ1贝叶斯深度学习方法是否能有效估计序列到序列 NMT 模型中的认知不确定性?
- RQ2所提出的不确定性度量 BLEUVar 是否与真实翻译场景中的误译及 OOD 输入相关?
- RQ3当将具有德语词汇特征的荷兰语句子输入到德语-英语 NMT 模型时,该不确定性估计在检测 OOD 输入方面的表现如何?
- RQ4不确定性估计是否可通过实现选择性分类或人机协同翻译来提升模型可靠性?
- RQ5该不确定性度量在不同句子长度和语言结构下的表现如何?
主要发现
- BLEUVar 在将使用德语词汇特征的荷兰语句子输入德语-英语 NMT 模型时,能够成功检测出分布外(OOD)输入。
- 模型的不确定性(以 BLEUVar 测量)与翻译质量密切相关,高不确定性表明可能存在误译。
- 在 WMT13 和 Europarl 数据集上,BLEUVar 高度可靠地识别出 OOD 输入,即使输入句子在语言上合理但分布上偏离领域。
- 与确定性 Transformer 相比,该方法在识别不确定或错误翻译方面表现更优,尤其在 OOD 输入上。
- 不确定性估计在不同句子长度下保持稳健,尽管长序列的不确定性得分方差略有增加。
- BLEUVar 展现出潜在的偏见检测能力,因为有偏见的训练数据可能导致 OOD 输入,而这些输入会被不确定性度量所标记。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。