Skip to main content
QUICK REVIEW

[论文解读] Breaking the Beam Search Curse: A Study of (Re-)Scoring Methods and Stopping Criteria for Neural Machine Translation

Yilin Yang, Liang Huang|arXiv (Cornell University)|Aug 28, 2018
Natural Language Processing Techniques参考文献 18被引用 14
一句话总结

本文識別出神經機器翻譯中束搜索困境的根本原因——束大小增加導致翻譯變短,這是因長度比例失真所致——並提出無超參數的重排序方法,包括 BP-Norm 和基於預測長度的有界詞獎勵,使 BLEU 提升 +2.0,超過長度歸一化方法。此外,本文還引入最佳停止條件,使性能再提升 +0.9 BLEU,在中英翻譯任務上達到當前最優水平。

ABSTRACT

Beam search is widely used in neural machine translation, and usually improves translation quality compared to greedy search. It has been widely observed that, however, beam sizes larger than 5 hurt translation quality. We explain why this happens, and propose several methods to address this problem. Furthermore, we discuss the optimal stopping criteria for these methods. Results show that our hyperparameter-free methods outperform the widely-used hyperparameter-free heuristic of length normalization by +2.0 BLEU, and achieve the best results among all methods on Chinese-to-English translation.

研究动机与目标

  • 解釋束搜索困境的根本原因,即束大小增加雖提升搜尋容量,卻導致翻譯品質下降。
  • 針對大束大小下產生較短翻譯的問題,形式化並改進現有的重排序方法。
  • 開發無超參數的重排序技術,使其在不需在開發集上調校的情況下,超越長度歸一化方法。
  • 研究最佳停止條件,透過動態控制生成長度來提升束搜索性能。
  • 在低資源、長序列翻譯任務中,特別是中英翻譯,驗證所提出方法的有效性。

提出的方法

  • 提出 BP-Norm,一種重排序方法,利用基於生成長度與參考長度比例的簡短懲罰來歸一化模型得分,無需超參數。
  • 引入有界詞獎勵,一種重排序機制,對每個生成詞施加固定獎勵,且獎勵上限由預測序列長度設定,以避免過度生成。
  • 使用長度預測模型在推理階段估算目標序列長度,用以提供束搜索的上限,並引導有界詞獎勵機制。
  • 提出最佳停止條件,當預期長度達成時動態終止束搜索,從而改善長度比例控制與翻譯品質。
  • 採用混合方法,結合長度預測與重排序,以在不同束大小下維持高 BLEU 分數。
  • 所有方法均使用標準神經機器翻譯訓練與推理流程,束搜索透過重排序與停止規則增強。

实验结果

研究问题

  • RQ1為何在神經機器翻譯中,束大小超過 5 後,翻譯品質反而下降,儘管搜尋容量增加?
  • RQ2如何設計無超參數的重排序方法,使其 BLEU 分數超越長度歸一化方法?
  • RQ3最佳停止條件對束搜索性能有何影響,特別是在控制翻譯長度與提升 BLEU 方面?
  • RQ4預測序列長度能否提升束搜索在多樣化輸入長度下的魯棒性與品質?
  • RQ5不同重排序策略在 BLEU 分數、長度比例以及長短序列上的泛化能力方面有何差異?

主要发现

  • 束搜索困境主要由束大小增加導致翻譯變短所引起,其根本原因為長度比例失真,而非資料不確定性或重複問題。
  • 所提出的無超參數方法 BP-Norm 在中英翻譯任務上,使 BLEU 比廣泛使用的長度歸一化基線提升 +2.0。
  • 僅使用最佳停止條件,即可使長度歸一化方法的性能提升 +0.9 BLEU,顯示其顯著影響。
  • 結合最佳停止與長度預測,有界詞獎勵方法在大束大小(b=39–41)下於測試集上達到最高 BLEU 分數 40.14。
  • BP-Norm 方法表現與更複雜的方法(如有界自適應獎勵與有界詞獎勵 r=1.4)相當,但無需超參數調校。
  • 所有所提方法在長度比例上均接近 1.0,特別是在較長輸入序列上,這些序列通常對神經機器翻譯系統更具挑戰性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。