[论文解读] Revisiting Round-Trip Translation for Quality Estimation
本文通過用基於SBERT和BERTScore的語義相似度度量取代BLEU之類的詞法度量,重新探討了用於機器翻譯品質評估的往返翻譯(RTT)方法。實驗結果顯示,在WMT19品質評估數據集上,RTT結合這些語義度量方法與人工判斷的相關性最高,優於當前最先进的一流QE方法YiSi-2,且在不同反向翻譯系統以及SMT與NMT前向模型中均表現出良好的魯棒性。
Quality estimation (QE) is the task of automatically evaluating the quality of translations without human-translated references. Calculating BLEU between the input sentence and round-trip translation (RTT) was once considered as a metric for QE, however, it was found to be a poor predictor of translation quality. Recently, various pre-trained language models have made breakthroughs in NLP tasks by providing semantically meaningful word and sentence embeddings. In this paper, we employ semantic embeddings to RTT-based QE. Our method achieves the highest correlations with human judgments, compared to previous WMT 2019 quality estimation metric task submissions. While backward translation models can be a drawback when using RTT, we observe that with semantic-level metrics, RTT-based QE is robust to the choice of the backward translation system. Additionally, the proposed method shows consistent performance for both SMT and NMT forward translation systems, implying the method does not penalize a certain type of model.
研究动机与目标
- 重新評估往返翻譯(RTT)作為一種無人工參考的品質評估(QE)方法的可行性。
- 探討語義層次的相似度度量是否能克服BLEU之類詞法度量在基於RTT的QE中的局限性。
- 評估基於RTT的QE在不同反向翻譯系統及前向翻譯架構(SMT對比NMT)下的魯棒性。
- 確定某種度量的句式重述檢測能力是否與其在基於RTT的QE中的表現相關。
提出的方法
- 使用SBERT和BERTScore計算原始輸入句子與其往返翻譯之間的語義相似度。
- 利用預訓練語言模型生成上下文相關的句子嵌入以計算語義相似度。
- 通過SBERT嵌入的餘弦相似度與BERTScore的詞級嵌入F1分數來衡量句子層次的相似度。
- 使用WMT19機器翻譯品質評估數據集上的人工判斷結果,以皮爾遜相關係數評估基於RTT的QE性能。
- 在不同反向翻譯系統與前向翻譯系統(SMT與NMT)之間比較性能表現。
- 在PAWS數據集上評估度量的表現,以評估其句式重述檢測能力。
实验结果
研究问题
- RQ1與BLEU之類的詞法度量相比,SBERT和BERTScore之類的語義層次相似度度量是否能提升基於RTT的品質評估性能?
- RQ2基於RTT的QE對反向翻譯系統變化的魯棒性如何?
- RQ3基於RTT的QE在不同前向翻譯架構(SMT對比NMT)下是否表現一致?
- RQ4基於RTT的QE性能在多大程度上與某種度量檢測重述句式的能力相關?
主要发现
- 在WMT19 QE共享任務中,RTT結合SBERT與BERTScore與人工判斷的皮爾遜相關係數最高,優於YiSi-2及其他基線方法。
- RTT-SBert與RTT-BERTScore在不同反向翻譯系統中表現穩定,表明對BT模型選擇具有良好的魯棒性。
- 當前向翻譯系統之間差異較大時,這些度量與BLEU表現相當,顯示出強大的泛化能力。
- SBERT與BERTScore在檢測重排或重述的輸入句子方面,顯著優於詞法度量(BLEU與chrF),特別是在句式重構的情況下。
- 在PAWS數據集上的AUC分數確認,SBERT與BERTScore具有更優越的句式重述檢測能力,且該能力與更高的基於RTT的QE性能直接相關。
- 研究發現,檢測語義重述句式的能力是基於語義度量的RTT-QE成功的重要因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。