[论文解读] Agreement-based Learning of Parallel Lexicons and Phrases from Non-Parallel Corpora
本文提出一种基于一致性的学习框架,通过联合训练从源语言到目标语言和从目标语言到源语言的潜在变量翻译模型,提升非平行语料中的对齐准确率。通过使用Viterbi EM算法强制双向短语和词对齐的一致性,该方法在短语对齐F1值(超过70%)和机器翻译BLEU得分(最高达19.78)方面取得显著提升,展现出对噪声的鲁棒性,并有效学习未见词典和短语。
We introduce an agreement-based approach to learning parallel lexicons and phrases from non-parallel corpora. The basic idea is to encourage two asymmetric latent-variable translation models (i.e., source-to-target and target-to-source) to agree on identifying latent phrase and word alignments. The agreement is defined at both word and phrase levels. We develop a Viterbi EM algorithm for jointly training the two unidirectional models efficiently. Experiments on the Chinese-English dataset show that agreement-based learning significantly improves both alignment and translation performance.
研究动机与目标
- 为解决现有方法在非平行语料中学习平行词典与短语时面临准确率低和对噪声敏感的问题。
- 通过利用不对称的从源到目标与从目标到源翻译模型之间的一致性,提升对齐与翻译性能。
- 通过基于共识的训练目标,联合优化短语级与词级对齐,增强对噪声数据的鲁棒性。
- 实现对初始种子词典之外的新颖未见词与短语对的发现。
提出的方法
- 提出一种语料级潜在变量翻译模型,联合建模非平行单语语料中的短语与词对齐。
- 引入两种损失函数——内部一致性和外部一致性——基于双向短语与词对齐的共识,以强制一致性。
- 采用Viterbi EM算法,通过近似期望最大化框架中的不可行推理,高效训练两个不对称模型。
- 使用对称的短语翻译模型,定义为 P(f|e;θ) = ∏ P(f|e;θ),其中参数在各模型间共享。
- 在EM的E步中应用类似Viterbi的解码步骤,以估计最可能的对齐路径,实现高效联合优化。
- 从一个小型种子词典出发,通过识别高概率的短语与词对齐,迭代扩展平行语料。
实验结果
研究问题
- RQ1在非平行语料中,强制双向翻译模型之间的一致性是否能提升对齐准确率?
- RQ2与独立训练相比,基于一致性的学习在噪声数据下的鲁棒性如何?
- RQ3基于一致性的学习在多大程度上能发现超出初始种子词典的新颖未见词与短语对?
- RQ4在短语与词对齐上达成共识,是否能提升下游机器翻译任务的性能?
主要发现
- 基于一致性的学习在测试集上达到超过70%的F1值,显著优于独立训练,即使在噪声条件下也表现优异。
- 内部一致性(短语与词对齐的共识)在对齐评估中始终优于外部一致性(仅短语级共识)。
- 在机器翻译中,基于一致性的学习在NIST 2005测试集上达到19.78的BLEU得分,优于独立学习,且使用的平行语料更小。
- 该方法成功学习到初始种子词典中不存在的新词与短语,如表3所示示例:'jiaoyisuo shichang jiage zhishu' → 'exchange market price index'。
- 该方法降低了对噪声的敏感性,在源语言与目标语言均被污染时仍能保持高性能,而先前方法在噪声下性能急剧下降。
- 通过基于一致性的学习迭代扩展平行语料,使对齐与翻译性能在10轮迭代中持续提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。