[論文レビュー] Fine-tuning Large Language Models for Adaptive Machine Translation
本稿では、医療分野における20,000件のゼロショットおよびワンショット翻訳プロンプトの混合データセットを用いて、Mistral 7B Large Language Modelをファインチューニングすることで、リアルタイムの適応的機械翻訳のためのコンテキスト内学習能力を向上させることを提案する。ファインチューニング済みモデルはゼロショット翻訳品質においてNLLB 3.3Bと同等の性能を達成し、ワンショット性能ではNLLB 3.3BおよびChatGPT "gpt-3.5-turbo"を上回った。これは、最小限のデータで効率的なオープンソースLLMが、専用および商業モデルと同等またはそれを上回る性能を発揮できることを示している。
This paper presents the outcomes of fine-tuning Mistral 7B, a general-purpose large language model (LLM), for adaptive machine translation (MT). The fine-tuning process involves utilising a combination of zero-shot and one-shot translation prompts within the medical domain. The primary objective is to enhance real-time adaptive MT capabilities of Mistral 7B, enabling it to adapt translations to the required domain at inference time. The results, particularly for Spanish-to-English MT, showcase the efficacy of the fine-tuned model, demonstrating quality improvements in both zero-shot and one-shot translation scenarios, surpassing Mistral 7B's baseline performance. Notably, the fine-tuned Mistral outperforms ChatGPT "gpt-3.5-turbo" in zero-shot translation while achieving comparable one-shot translation quality. Moreover, the zero-shot translation of the fine-tuned Mistral matches NLLB 3.3B's performance, and its one-shot translation quality surpasses that of NLLB 3.3B. These findings emphasise the significance of fine-tuning efficient LLMs like Mistral 7B to yield high-quality zero-shot translations comparable to task-oriented models like NLLB 3.3B. Additionally, the adaptive gains achieved in one-shot translation are comparable to those of commercial LLMs such as ChatGPT. Our experiments demonstrate that, with a relatively small dataset of 20,000 segments that incorporate a mix of zero-shot and one-shot prompts, fine-tuning significantly enhances Mistral's in-context learning ability, especially for real-time adaptive MT.
研究の動機と目的
- 一般用途のLLM(例:Mistral 7B)のリアルタイム適応的機械翻訳のためのコンテキスト内学習能力を向上させること。
- ゼロショットおよびワンショットプロンプトの小規模で混合されたデータセットを用いたファインチューニングが、医療分野における翻訳品質を向上させるかどうかを評価すること。
- ファインチューニング済みMistral 7Bの性能を、タスク特化モデル(NLLB 3.3B)および商業モデル(ChatGPT "gpt-3.5-turbo")と、ゼロショットおよびワンショット翻訳の両状況で比較すること。
- 最小限のファインチューニングデータで、自己ホスティング可能でプライバシーを守る翻訳システムを実現するため、オープンソースLLMを活用すること。
提案手法
- 医療分野のデータソース(ELRC、EMEA、SciELO、TICO-19)から得た10,000件のゼロショットおよび10,000件のワンショット翻訳ペアの混合データセットを用いて、Mistral 7Bをファインチューニングした。
- リアルタイムの適応を模倣するため、ゼロショットではソース文のみを含むプロンプトテンプレート、ワンショットではソース文とファジィマッチペア、その後にターゲットセグメントを含むプロンプトテンプレートを採用した。
- 推論時におけるドメイン適応を模倣するために、50,000セグメントのコンテキストデータセットからファジィマッチを検索するリtrievalパイプラインを活用した。
- トレーニングに19,000セグメント、検証に1,000セグメントを用い、別個のテストセット(10,000セグメント)と独自のコンテキストデータセットを用意した。
- ゼロショットおよびワンショットの両状況で、BLEU、chrF++、TER、COMETメトリクスを用いて翻訳品質を評価した。
- 同じ条件下で、ファインチューニング済みMistral 7BをベースラインのMistral 7B、NLLB 3.3B、ChatGPT "gpt-3.5-turbo"と比較した。
実験結果
リサーチクエスチョン
- RQ1ゼロショットおよびワンショットプロンプトの小規模で混合されたデータセットを用いた、一般用途LLM(例:Mistral 7B)のファインチューニングが、適応的機械翻訳のためのコンテキスト内学習能力を顕著に向上させ得るか?
- RQ2ファインチューニング済みMistral 7Bは、医療分野におけるタスク特化モデル(例:NLLB 3.3B)と同等のゼロショット翻訳品質を達成できるか?
- RQ3ファインチューニング済みMistral 7Bは、商業モデル(例:ChatGPT "gpt-3.5-turbo")のワンショット適応翻訳性能と同等またはそれを上回る性能を発揮できるか?
- RQ4ファインチューニングは、推論時に1つのファジィマッチのみを用いて、ドメイン特化用語およびスタイルへの適応能力をどの程度向上させるか?
主な発見
- ワンショット翻訳において、ファインチューニング済みMistral 7BはBLEUスコア49.69を達成し、NLLB 3.3B(47.42)およびChatGPT "gpt-3.5-turbo"(48.34)を上回った。
- ゼロショット翻訳において、ファインチューニング済みMistral 7BはBLEUスコア46.71を記録し、NLLB 3.3B(47.02)と同等の性能を示し、タスク特化モデルと同等の性能を達成した。
- ワンショット翻訳において、ファインチューニング済みMistral 7BはCOMETスコア79.62を達成し、ChatGPT "gpt-3.5-turbo"(80.25)およびNLLB 3.3B(64.57)を上回った。これは、より優れたスムーズさと適切さを示している。
- わずか20,000セグメントのファインチューニングで、モデルはコンテキスト内学習能力を向上させ、一般および適応的翻訳性能の両方を強化した。
- ファインチューニング済みMistral 7Bは、ChatGPT "gpt-3.5-turbo"と同等のワンショット性能を達成しながらも、より効率的かつ自己ホスティング可能であり、商業モデルの代替としてプライバシーを守る選択肢を提供した。
- 結果から、効率的なオープンソースLLMにファインチューニングを施すことで、専用および商業モデルと同等の翻訳品質が得られ、特にドメイン特化のコンテキスト内学習を活用することで顕著に向上することが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。