[論文レビュー] Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
Seed-ASR は、音声条件下の大規模言語モデル(AcLLM)アーキテクチャを活用して、複数言語、方言、発音、分野にわたる多様な発話タイプの認識を向上させる、大規模言語モデル(LLM)ベースの自動音声認識(ASR)システムを提案する。連続的発話表現と文脈情報を統合し、自己教師あり事前学習、教師あり微調整、文脈に配慮した微調整、強化学習を含む段階的訓練手法を採用することで、公開および社内ベンチマークにおいて、最先端モデル比で相対的に10%〜40%の語誤り率(WER)低減を達成した。
Modern automatic speech recognition (ASR) model is required to accurately transcribe diverse speech signals (from different domains, languages, accents, etc) given the specific contextual information in various application scenarios. Classic end-to-end models fused with extra language models perform well, but mainly in data matching scenarios and are gradually approaching a bottleneck. In this work, we introduce Seed-ASR, a large language model (LLM) based speech recognition model. Seed-ASR is developed based on the framework of audio conditioned LLM (AcLLM), leveraging the capabilities of LLMs by inputting continuous speech representations together with contextual information into the LLM. Through stage-wise large-scale training and the elicitation of context-aware capabilities in LLM, Seed-ASR demonstrates significant improvement over end-to-end models on comprehensive evaluation sets, including multiple domains, accents/dialects and languages. Additionally, Seed-ASR can be further deployed to support specific needs in various scenarios without requiring extra language models. Compared to recently released large ASR models, Seed-ASR achieves 10%-40% reduction in word (or character, for Chinese) error rates on Chinese and English public test sets, further demonstrating its powerful performance.
研究の動機と目的
- 複数言語、方言、発音、分野にわたる多様な発話入力を処理できる、より正確で汎用性の高いASRシステムの開発。
- 外部言語モデルに大きく依存するエンドツーエンドASRモデルの限界を克服し、文脈的推論や非ドメイン一般化に課題を抱えること。
- 音声条件下の大規模言語モデル(LLM)フレームワーク内に、LLMの推論力と知識能力を活用し、文字起こしの正確性と文脈認識を向上させる。
- 追加の言語モデルを必要とせず、さまざまなアプリケーションシナリオに統合的かつカスタマイズ可能なデプロイメントを可能にする。
- 自己教師あり学習、教師あり微調整、文脈に配慮した適応、強化学習を段階的に組み合わせたスケーラブルな段階的訓練手法を確立する。
提案手法
- モデルは、生の音声入力から連続的発話表現を抽出する、約20億パラメータの音声エンコーダーを使用する。
- これらの表現は、対話履歴や映像編集の文脈などのテキスト的文脈と融合され、数十数十億パラメータを持つMixture-of-Experts(MoE)LLMに供給される。
- フレームワークは、LLMが音声特徴と文脈プロンプトの両方に条件付けられて次トークン予測を実行する音声条件下のLLM(AcLLM)パラダイムに従う。
- 段階的訓練手法が採用される:(1) 2000万時間以上の生音声を用いた自己教師あり事前学習、(2) 一対のASRデータを用いた教師あり微調整、(3) 豊富な文脈信号を用いた文脈に配慮した微調整、(4) 文字起こしの正確性目標に一致させるために強化学習による最適化。
- 文脈に配慮した微調整は、会議履歴や対話フローなどの周囲の文脈的手がかりと発話内容との間の依存関係をモデル化することで、キーワードのリコールを明確に向上させる。
- 強化学習は、リファレンス文字起こしと一致するように報酬モデルを用いて、モデル出力を最適化することで、意味的に重要なフレーズの文字起こし品質を向上させる。
実験結果
リサーチクエスチョン
- RQ1LLMベースのASRシステムは、低リソース言語や地方的方言を含む多様な発話タイプを、エンドツーエンドモデルよりも顕著に優れた認識性能で処理できるか?
- RQ2文脈に配慮した微調整は、会話的かつマルチターンな設定において、キーワードリコールと文字起こしの一貫性をどの程度向上できるか?
- RQ3自己教師あり学習、教師あり微調整、文脈適応、強化学習を組み合わせた段階的訓練手法は、ASRにおいてどの程度効果的か?
- RQ4統合的でLLMベースのアーキテクチャは、別個の言語モデルを必要とせず、複数の分野や言語で性能を維持または向上させることができるか?
- RQ5モデルは、音声的・意味的変動が複雑な長時間発話や未学習のドメインに対して、どの程度一般化できるか?
主な発見
- Seed-ASR (ML) は、英語のマルチドメイン評価セットで5.34%のWERを達成し、最も強力なベースライン(Whisper Large-v3 10.41% WER)と比較して相対的に49%の低減を実現した。
- 英語のマルチ発音およびハードケース評価セットでは、Seed-ASR (ML) は11.26%のWERと87.94%のF1スコアを達成し、Whisper Large-v3(21.52% WER、79.54% F1)およびGoogle USM(22.19% WER、63.30% F1)を上回った。
- 多言語・マルチドメイン評価セットでは、Seed-ASR (ML) は12.16%のWERを達成し、最も強力なベースライン(Whisper Large-v3 20.55% WER)と比較して相対的に42%の改善を示した。
- 公開テストセットでは、14言語で最先端の性能を達成し、Librispeech test-clean では1.58%、test-other では2.84%、Tedlium 3 では3.11%のWERを記録し、報告済みのすべてのベースラインを上回った。
- アラビア語(13.05% WER)、スペイン語(2.50% WER)、日本語(3.46% WER)といった低リソース言語に対しても、Seed-ASR (ML) は優れた一般化性能と競争力のある性能を示した。
- 文脈に配慮した微調整段階は、会話的かつ文脈が豊富なシナリオにおいてキーワードリコールを顕著に向上させ、モデルが文脈的情報を効果的に活用できる能力を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。