QUICK REVIEW
[论文解读] Counterfactual Learning for Machine Translation: Degeneracies and Solutions
Carolin Lawrence, Pratik Gajane|arXiv (Cornell University)|Nov 23, 2017
Machine Learning and Algorithms参考文献 12被引用 6
一句话总结
本文分析了在确定性日志策略下(无探索)机器翻译中反向倾向评分(IPS)和重加权估计器的退化问题。提出并验证了双重稳健和重加权估计器,通过引入直接奖励估计避免性能下降,从而实现无需在线探索即可从真实用户反馈中进行有效离线学习。
ABSTRACT
Counterfactual learning is a natural scenario to improve web-based machine translation services by offline learning from feedback logged during user interactions. In order to avoid the risk of showing inferior translations to users, in such scenarios mostly exploration-free deterministic logging policies are in place. We analyze possible degeneracies of inverse and reweighted propensity scoring estimators, in stochastic and deterministic settings, and relate them to recently proposed techniques for counterfactual learning under deterministic logging.
研究动机与目标
- 识别并形式化在机器翻译中,针对随机和确定性日志策略下反向倾向评分(IPS)及其重加权变体的退化问题。
- 解释为何标准的离策略估计器在无探索的确定性日志策略下会失效,此时倾向得分固定为1。
- 证明通过引入直接奖励预测,双重稳健和重加权估计器能够克服这些退化问题。
- 通过使用日志用户反馈验证这些方法在无需在线探索的情况下提升翻译质量的有效性。
- 为将反事实学习应用于真实世界、生产规模的机器翻译系统提供理论和实证依据。
提出的方法
- 提出一种重加权确定性倾向匹配(DPM+R)目标,通过模型自身的输出概率对预测奖励进行归一化,以纠正日志偏差。
- 引入一种双重稳健(DR)估计器,结合反向倾向评分与学习到的直接奖励预测器,以降低方差并避免退化。
- 对双重稳健估计器应用方差最小化标量 $\hat{c}$,得到 $\hat{c}$DC 目标,以提升稳定性和性能。
- 使用加权重要性采样对日志数据进行重加权,即使在日志策略为确定性的情况下也能实现无偏估计。
- 在训练过程中采用早停策略,防止模型收敛到概率质量被转移到低奖励输出的退化解。
- 在德语-英语和法语-英语翻译任务上验证方法,使用BLEU分数作为奖励信号进行领域内适应。
实验结果
研究问题
- RQ1在机器翻译中,反向倾向评分及其重加权变体在确定性日志下的理论退化问题是什么?
- RQ2为何标准的离策略估计器在真实世界翻译系统中应用于确定性日志策略时会失效?
- RQ3如何将直接奖励估计整合到离策略学习中,以在确定性日志下实现稳定和性能提升?
- RQ4双重稳健和重加权估计器是否能有效避免退化行为,并在从日志反馈进行离线学习时优于标准方法?
- RQ5在无需在线探索的情况下,这些方法在领域适应场景中能多大程度上提升翻译质量?
主要发现
- DPM+R 和 $\hat{c}$DC 估计器通过将概率质量重新分配至高奖励输出(即使这些输出未在日志中出现)成功避免了退化。
- 在德语-英语 TED 演讲领域,$\hat{c}$DC 在测试集上相比域外基线模型实现了 +2.02 BLEU 点的提升。
- 在法语-英语新闻领域,$\hat{c}$DC 在测试集上实现了 +1.13 BLEU 点的提升,优于所有其他方法。
- $\hat{c}$DC 方法在确定性日志下,对两种语言对和评估集均持续实现了最高性能提升。
- 确定性日志与随机日志之间的性能差距较小,表明所提方法即使在无随机探索的情况下也具有鲁棒性。
- 重加权和双重稳健估计器通过避免将概率质量分配给低奖励输出,防止了模型性能下降,而标准 IPS 方法则无法避免此问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。