[論文レビュー] Speech Translation with Large Language Models: An Industrial Practice
本稿では、大規模言語モデル(LLM)とWhisperベースの音声エンコーダーを統合することで、長時間の音声入力から正確でタイムスタンプ付きの字幕および翻訳を生成するエンドツーエンドの音声翻訳システム、LLM-STを提案する。マルチタスクのインstructチューニング(Chain-of-Thoughtプロンプティングを含む)を活用することで、LLM-STは、プロソディー、コードスイッチィング、専門用語の処理において、オープンソースモデルおよび商用のカスケードシステムを上回る性能を発揮する。
Given the great success of large language models (LLMs) across various tasks, in this paper, we introduce LLM-ST, a novel and effective speech translation model constructed upon a pre-trained LLM. By integrating the large language model (LLM) with a speech encoder and employing multi-task instruction tuning, LLM-ST can produce accurate timestamped transcriptions and translations, even from long audio inputs. Furthermore, our findings indicate that the implementation of Chain-of-Thought (CoT) prompting can yield advantages in the context of LLM-ST. Through rigorous experimentation on English and Chinese datasets, we showcase the exceptional performance of LLM-ST, establishing a new benchmark in the field of speech translation. Demo: https://speechtranslation.github.io/llm-st/.
研究の動機と目的
- 複雑なカスケードパイプラインに代わって単一モデルで代替可能な統合的でエンドツーエンドの音声翻訳システムの開発。
- 事前学習済みLLMの文脈理解力と音声表現を統合することで、長時間音声の翻訳品質を向上。
- Chain-of-Thoughtプロンプティングおよびマルチタスクインstructチューニングの有効性を評価し、翻訳の耐性向上に寄与すること。
- 完全にエンドツーエンドの音声翻訳システムの産業的実装可能性を示し、商用カスケードモデルを凌駕すること。
- 発音翻訳および翻訳説明タスクが、コードスイッチィングおよび固有名称翻訳の改善に果たす役割を調査すること。
提案手法
- LLM-STは、16kHzの音声から連続的な音声表現を抽出するため、Whisper-Large-v2エンコーダーを用い、離散化を一切行わない。
- 音声表現は、130億パラメータのデコーダー専用LLM(GPT-3に類似)に条件付けられ、自然言語の指示に基づいてテキスト出力を生成する。
- マルチタスクインstructチューニングには、ASR、機械翻訳、転写、文分割、ITN、タイムスタンプ予測が含まれ、これらを同時に学習する。
- 推論の質と出力の透明性を向上させるために、インstructチューニング中にChain-of-Thought(CoT)プロンプティングを適用する。
- 1300万組の翻訳ペアと多数の生テキストを含む大規模な英中語音声およびテキストデータセットを用いて、モデルをファインチューニングする。
- Whisperの30秒制限を解除することで、任意長の音声入力をサポートするフレームワークを実現する。
実験結果
リサーチクエスチョン
- RQ1統合的エンドツーエンドモデルは、カスケードシステムと比較して、音声翻訳で優れた性能を達成できるか?
- RQ2Chain-of-Thoughtプロンプティングを含むマルチタスクインstructチューニングは、翻訳品質および耐性をどのように向上させるか?
- RQ3連続的な音声表現を有する事前学習済みLLMは、プロソディー、コードスイッチィング、ドメイン特化用語をどの程度適切に処理できるか?
- RQ4インstructチューニングに発音翻訳(例:IPA/pinyin)を組み込むことで、コードスイッチィング音声翻訳の性能は向上するか?
- RQ5エンドツーエンドモデルは、カスケードシステムと同等の解釈可能な中間出力を提供できるか?
主な発見
- LLM-STは、自動評価および人的評価の両方で、英中語音声翻訳分野で最先端の性能を達成し、オープンソースモデルおよび商用カスケードシステムを上回る。
- 人的評価により、LLM-STは特にプロソディー、文脈依存翻訳、コードスイッチィングの処理において、商用カスケードシステムを上回ることが確認された。
- 商業用ASRモデルが音声的誤解により失敗する場合でも、ブランド名(例:Vetements、Balenciaga)などの専門用語を正しく翻訳する。
- マルチタスクチューニングに発音翻訳(IPA/pinyin)を組み込むことで、コードスイッチィング翻訳の性能が顕著に向上した。
- Chain-of-Thoughtプロンプティングにより、推論能力と出力の解釈可能性が向上し、エンドツーエンドモデルが中間ステップの可視化を提供できることを示した。
- 入力長制限なしに長時間音声入力に対しても高い性能を維持でき、正確なタイムスタンプ付き出力を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。