[論文レビュー] Faster Re-translation Using Non-Autoregressive Model For Simultaneous Neural Machine Translation
本稿では、同時逐次ニューラル機械翻訳における非自己回帰的再翻訳モデルFReTNAを提案する。FReTNAは、並列にターゲット系列を生成することで、自己回帰的再翻訳(ReTA)と比較して推論時間を10倍短縮するが、高い翻訳品質を維持する。この手法は、効率的な挿入・削除を可能にするLevenshtein Transformerを採用し、動的翻訳におけるユーザーが感じ取りやすいフレイクタの正確な捉え込みを可能にする新たな安定性指標NCNEを導入する。
Recently, simultaneous translation has gathered a lot of attention since it enables compelling applications such as subtitle translation for a live event or real-time video-call translation. Some of these translation applications allow editing of partial translation giving rise to re-translation approaches. The current re-translation approaches are based on autoregressive sequence generation models (ReTA), which generate tar-get tokens in the (partial) translation sequentially. The multiple re-translations with sequential generation inReTAmodelslead to an increased inference time gap between the incoming source input and the corresponding target output as the source input grows. Besides, due to the large number of inference operations involved, the ReTA models are not favorable for resource-constrained devices. In this work, we propose a faster re-translation system based on a non-autoregressive sequence generation model (FReTNA) to overcome the aforementioned limitations. We evaluate the proposed model on multiple translation tasks and our model reduces the inference times by several orders and achieves a competitive BLEUscore compared to the ReTA and streaming (Wait-k) models.The proposed model reduces the average computation time by a factor of 20 when compared to the ReTA model by incurring a small drop in the translation quality. It also outperforms the streaming-based Wait-k model both in terms of computation time (1.5 times lower) and translation quality.
研究の動機と目的
- 同時ニューラル機械翻訳における自己回帰的再翻訳(ReTA)モデルの高い推論時間の問題を解決すること。これは、入力長が延びるにつれて増加する。
- 逐次的自己回帰的デコードの代わりに並列的非自己回帰的生成を採用することで、再翻訳システムにおけるウォールクロック遅延を低減すること。
- 挿入、削除、置換によるテキストのフレイクタをより的確に捉える、より感受性の高い安定性指標を導入することで、ユーザー体験を向上させること。
- 非自己回帰的再翻訳が、ReTAおよびストリーミングWait-kモデルの両方の速度と翻訳品質において優れていることを示すこと。
提案手法
- Levenshtein Transformerに基づく非自己回帰的再翻訳モデルFReTNAを提案する。推論時に複数のトークンの同時挿入・削除を可能にする。
- Levenshtein Transformerの学習目的を修正し、補正ベースの生成をサポートすることで、完全な自己回帰的再生成を回避する効率的な再翻訳を実現する。
- 推論時に位置バイアスを導入し、トークン予測をガイドすることで、特に低遅延環境下でのフレイクタを低減する。
- 連続する翻訳間の挿入・削除・置換を数えることで、テキストの不安定性を定量化する新しい安定性指標、正規化クリック・アンド・エディット(NCNE)を採用する。
- 各新しいソース入力に対して、部分翻訳全体を再生成する再翻訳戦略を採用するが、並列処理により逐次的自己回帰的生成を回避する。
- 部分翻訳におけるアライメントとパフォーマンスの向上を図るため、プレフィックス拡張損失を用いてモデルを学習する。
実験結果
リサーチクエスチョン
- RQ1非自己回帰的生成は、再翻訳ベースの同時ニューラル機械翻訳における推論時間を顕著に短縮できるか?
- RQ2提案されたFReTNAモデルは、ReTAおよびWait-kモデルと比較して、翻訳品質と計算効率の両面で優れているか?
- RQ3新規のNCNE指標は、従来のNE指標よりもユーザーが感じ取りやすいテキストのフレイクタをより正確に捉えられるか?
- RQ4位置バイアスは、低遅延再翻訳環境下で安定性を向上させ、フレイクタを低減するのにどの程度寄与するか?
主な発見
- 提案されたFReTNAモデルは、ReTAモデルと比較して平均計算時間を10倍短縮し、わずかな翻訳品質の低下で顕著な高速化を達成した。
- FReTNAはストリーミングWait-kモデルを上回り、計算時間を1.5倍短縮するとともに、より高い翻訳品質を達成した。
- 位置バイアスを導入したFReTNA_posは、FReTNA_non_posよりも低いNCNEスコアを達成しており、特に低遅延環境下でのフレイクタ低減が確認された。
- NCNE指標はNE指標よりも多くのフレイクタを検出しており、最初の違いポイントのみを考慮するのではなく、すべてのトークンレベルの変更(挿入、削除、置換)をカウントするためである。
- 低遅延設定では、FReTNA_non_posは過剰予測とその後のトークン削除により高いフレイクタを示したが、FReTNA_posでは位置バイアスのおかげでこれを緩和した。
- 推論遅延を顕著に低減しながらも、高い翻訳品質を維持しているため、リソース制約のあるデバイスにおけるリアルタイム応用に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。