[論文レビュー] Improving Translation Faithfulness of Large Language Models via Augmenting Instructions
本稿では、大規模言語モデルにおける翻訳忠実度の向上を目的として、SWIE(Segment-Weighted Instruction Embedding)とOverMiss——対照的命令微調整データセット——を提案する。SWIEはセグメント重み付き埋め込みを用いてモデルの命令への注目を強化するのに対し、OverMissは過剰翻訳および漏れ翻訳の誤りを是正することを目的としている。これらの手法は、BLOOMZおよびLLaMAモデルにおけるゼロショット、長文文脈、少サンプル設定において、BLEUスコア(最大+0.56)および忠実度メトリクスを顕著に向上させる。
Large Language Models (LLMs) present strong general capabilities, and a current compelling challenge is stimulating their specialized capabilities, such as machine translation, through low-cost instruction tuning. The standard instruction-following data is sequentially organized as the concatenation of an instruction, an input, and a response. As the attention mechanism of LLMs has limitations on local focus, LLMs tend to focus more on the words or sentences nearby at each position. This leads to a high risk of instruction forgetting during decoding. To alleviate the above issues, We propose SWIE (Segment-Weighted Instruction Embedding) and an instruction-following dataset OVERMISS. SWIE improves the model instruction understanding by adding a global instruction representation on the following input and response representations. OVERMISS improves model faithfulness by comparing over-translation and miss-translation results with the correct translation. We apply our methods to two main-stream open-source LLMs, BLOOM and LLaMA. The experimental results demonstrate significant improvements in translation performance with SWIE based on BLOOMZ-3b, particularly in zero-shot and long text translations due to reduced instruction forgetting risk. Additionally, OVERMISS outperforms the baseline in translation performance (e.g. an increase in BLEU scores from 0.69 to 3.12 and an average improvement of 0.48 percentage comet scores for LLaMA-7b) with further enhancements seen in models combining OVERMISS and SWIE (e.g. the BLUE scores increase up to 0.56 from English to German across three different backbones), and both exhibit improvements in the faithfulness metric based on word alignment.
研究の動機と目的
- 局所的注目バイアスに起因する因果的言語モデルにおける翻訳デコード時における命令の忘れを是正すること。
- 幻覚(特に過剰翻訳および漏れ翻訳)を低減することで翻訳忠実度を向上させること。
- 忠実度向上を目的とした対照的ネガティブサンプルを生成するデータ構築手法の開発。
- SWIEおよびOverMissの有効性を多様なバックボーンモデルおよび翻訳ベンチマークで検証すること。
- 注目分布の分析を行い、SWIEが特に中間層において命令への注目を増加させることを示すこと。
提案手法
- SWIEは、グローバルな命令表現を入力および応答表現に組み込むためのパラメータ化されたアダプタを導入し、命令トークンの強調を図るセグメント重み付き注目を採用する。
- 本手法は、層間の注目スコアの重み付き和を用い、入力および出力のスパンに対して比較して命令スパンへの注目を強化する。
- OverMissは、過剰翻訳および漏れ翻訳を避けるように明示的にプロンプトを提示することで、対照的ネガティブサンプルを構築する新しい命令微調整データセットである。
- 「過剰翻訳をしない」や「漏れ翻訳をしない」などの指示を含み、モデルが忠実な出力を生成するように誘導する。
- 忠実度は、多言語間語彙アライメントを用いて源語および標語のカバレッジレートを計算し、平均リCALLを指標として用いる。
- モデル層に跨る内部注目スコアを可視化し、ベースラインモデルとSWIEモデルを比較することで、SWIEが命令の終端部への注目を増加させることを示している。
実験結果
リサーチクエスチョン
- RQ1セグメント重み付き埋め込みによる命令への注目強化は、翻訳中における因果的LLMの命令忘れを低減するか?
- RQ2OverMissを用いた対照的命令微調整は、過剰翻訳および漏れ翻訳の誤りを効果的に低減できるか?
- RQ3SWIEは特に命令忘れが最も顕著に現れる中間層において、注目分布にどのように影響を与えるか?
- RQ4SWIEおよびOverMissは、ゼロショットおよび長文文脈翻訳タスクにおいて、翻訳性能および忠実度にどの程度向上効果を示すか?
- RQ5SWIEとOverMissの組み合わせは、BLEUおよび忠実度メトリクスにおいて相乗効果をもたらすか?
主な発見
- SWIEは、WMT22の4つの翻訳方向においてBLEUスコアを0.19から0.51に向上させ、BLOOMZ-3bを用いた6つのゼロショット方向では0.20から0.58に向上させた。
- 長文翻訳においては、BLOOMZ-3bがSWIEを用いて平均BLEUスコア0.67を達成し、長文文脈設定における性能向上を示した。
- OverMissは、WMT22テストセットにおいてBLEUスコアを0.69から3.12に向上させ、LLaMA-7bでは平均COMETスコアを0.48ポイント向上させた。
- SWIEとOverMissの組み合わせは、3つのバックボーンモデルを用いた英語→ドイツ語翻訳において、BLEUスコアを最大0.56向上させた。
- 語彙アライメントを用いた忠実度評価では、OverMissを用いた場合のスコアが87.94(Parrot-hint)から88.84に上昇し、両手法を併用した場合は88.80に上昇した。
- 注目可視化により、SWIEが中間層において命令の終端部への注目比を最大20%まで増加させることを確認し、命令忘れの低減が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。