[论文解读] Attaining the Unattainable? Reassessing Claims of Human Parity in Neural Machine Translation
本文通過在更嚴格的人工評估條件下重新評估微軟的數據集,挑戰了神經機器翻譯(NMT)在中譯英新聞翻譯中達成人類水平的說法。研究發現,當使用原始中文來源文本(而非從英文翻譯而來的文本),且由專業翻譯員在完整語境下評估翻譯時,人工翻譯與機器翻譯之間仍存在顯著差異,表明人類水平尚未實現。
We reassess a recent study (Hassan et al., 2018) that claimed that machine translation (MT) has reached human parity for the translation of news from Chinese into English, using pairwise ranking and considering three variables that were not taken into account in that previous study: the language in which the source side of the test set was originally written, the translation proficiency of the evaluators, and the provision of inter-sentential context. If we consider only original source text (i.e. not translated from another language, or translationese), then we find evidence showing that human parity has not been achieved. We compare the judgments of professional translators against those of non-experts and discover that those of the experts result in higher inter-annotator agreement and better discrimination between human and machine translations. In addition, we analyse the human translations of the test set and identify important translation issues. Finally, based on these findings, we provide a set of recommendations for future human evaluations of MT.
研究动机与目标
- 使用更嚴謹的人工評估標準,批判性地重新評估神經機器翻譯在中譯英翻譯中達成人類水平的說法。
- 調查翻譯語體(原本以英文撰寫的中文文本)的納入是否在人工評估中對機器翻譯產生偏倚。
- 評估評估者專業程度對評估者間一致性以及對人工與機器翻譯區分能力的影響。
- 檢查WMT與微軟測試集中的人工參考翻譯是否存在缺陷或後續編輯的影響。
- 為未來的人工翻譯評估提供可操作的建議,以提升評估的可靠性與區分能力。
提出的方法
- 使用修改後的人工評估協定,僅針對原始中文來源文本,重新評估微軟的NMT系統在WMT 2017測試集上的表現。
- 使用專業翻譯員與非專業評估者,對人工翻譯與機器翻譯進行成對排名比較。
- 分析不同評估者群組之間的評估者間一致性(IAA)與翻譯品質分數,以評估一致性與敏感度。
- 在完整文檔語境下評估翻譯,以考慮句子間的語義依存關係,而非僅僅孤立地評估單句。
- 識別出WMT與微軟數據集中人工參考翻譯中的語言問題,暗示可能存在非專業翻譯員參與或機器翻譯輸出被後續編輯的情況。
- 公開發布匿名化的人工評估數據與統計分析結果,以確保可重現性與透明度,遵循Hassan等人(2018)的開放數據模式。
实验结果
研究问题
- RQ1測試集中納入原本以英文撰寫的中文文本(翻譯語體)是否會在人工評估中虛高機器翻譯得分?
- RQ2與非專業評估者相比,專業翻譯員是否產生更高的評估者間一致性與更好的人工與機器翻譯區分能力?
- RQ3當使用原始來源文本且評估者獲得完整語境資訊時,人工翻譯與機器翻譯之間是否存在統計上顯著的品質差異?
- RQ4WMT與微軟測試集中的人工參考翻譯在多大程度上受到非專業水準品質或機器翻譯輸出後續編輯的影響?
- RQ5為確保人工評估在神經機器翻譯系統持續進步時仍具備可靠性與區分能力,需要哪些方法論上的改進?
主要发现
- 當僅評估原始中文來源文本(而非從英文翻譯而來的文本)時,有強烈證據顯示人工翻譯品質尚未達成人類水平。
- 專業翻譯員產生了顯著更高的評估者間一致性,並在人工與機器翻譯品質之間展現更寬的差距,而非專業評估者則不然。
- 測試集中存在翻譯語體(原本以英文撰寫的中文文本)導致機器翻譯得分提高,顯示存在一種混淆效應,使機器翻譯獲得優勢。
- WMT與微軟的參考翻譯均被發現存在翻譯問題,暗示可能使用了非專業翻譯員或對機器翻譯輸出進行了後續編輯。
- 本研究確認人工評估仍是MT評估中有效且不可或缺的工具,但僅當使用專業評估者、原始來源文本與完整語境資訊時方能成立。
- 作者提出一組未來評估的建議,包括使用原始來源文本、專業評估者與文檔級語境,以確保翻譯品質評估的穩健性與公平性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。