[論文レビュー] Low-Latency Sequence-to-Sequence Speech Recognition and Translation by Partial Hypothesis Selection
本稿では、部分仮説選択、単方向エンコーダー、および部分シーケンスへの適応を用いた、低遅延なシーケンス・ツー・シーケンス音声認識および翻訳フレームワークを提案する。How2 ASR データセットでは0.8秒の遅延削減(83%)を達成し、WERは1%増加にとどまる一方、音声翻訳では0.7秒の遅延削減(84%)を達成し、相対BLEUスコアは5%低下するが、選択的出力コミットと効率的な推論により高い精度を維持する。
Encoder-decoder models provide a generic architecture for sequence-to-sequence tasks such as speech recognition and translation. While offline systems are often evaluated on quality metrics like word error rates (WER) and BLEU, latency is also a crucial factor in many practical use-cases. We propose three latency reduction techniques for chunk-based incremental inference and evaluate their efficiency in terms of accuracy-latency trade-off. On the 300-hour How2 dataset, we reduce latency by 83% to 0.8 second by sacrificing 1% WER (6% rel.) compared to offline transcription. Although our experiments use the Transformer, the hypothesis selection strategies are applicable to other encoder-decoder models. To avoid expensive re-computation, we use a unidirectionally-attending encoder. After an adaptation procedure to partial sequences, the unidirectional model performs on-par with the original model. We further show that our approach is also applicable to low-latency speech translation. On How2 English-Portuguese speech translation, we reduce latency to 0.7 second (-84% rel.) while incurring a loss of 2.4 BLEU points (5% rel.) compared to the offline system.
研究の動機と目的
- オンラインのシーケンス・ツー・シーケンスモデルにおける高遅延の課題に対処すること。
- 再訓練を必要とせず、オフラインおよびオンライン推論の両方を1つのモデルで対応可能にすること。
- チャンクベースのインクリメンタル推論における遅延を低減しながら、自動音声認識および翻訳の品質の劣化を最小限に抑えること。
- 部分仮説への選択的コミットにより、ストリーミング推論中の予測を安定化する戦略を検討すること。
- 事前学習済みのフルシーケンスモデルを、最小限の性能低下でインクリメンタル推論に適応する手法を開発すること。
提案手法
- 将来のコンテキストを排除する単方向エンコーダーを用い、将来の依存関係なしに効率的な段階的デコードを可能にする。
- 各チャンクの出力から部分的なプレフィックスのみをコミットすることで、部分仮説選択を実装し、不安定な予測を低減する。
- プレフィックス関数を、固定出力レートのホールド-n戦略や、コンSENSUSベースの選択であるローカルアヘンド戦略などの戦略により実装する。
- ストリーミング入力をシミュレートする微調整手順により、事前学習済みモデルを部分シーケンスに適応する。
- 直前のチャンクからのコミット済み仮説をデコーダーに条件付け、文脈に配慮した段階的生成を可能にする。
- 固定されたチャンクサイズを用い、新しい音声セグメントが到着する度に段階的にデコードする。デコーダー状態を再利用することで再計算を回避する。
実験結果
リサーチクエスチョン
- RQ1部分仮説選択は、ストリーミングASRおよび音声翻訳における遅延-品質トレードオフをどのように改善できるか?
- RQ2フルシーケンスで学習された単方向エンコーダーは、最小限の精度損失でインクリメンタル推論に効果的に適応可能か?
- RQ3ホールド-n、ローカルアヘンド、ホールド-0の各仮説選択戦略の中で、遅延と品質のバランスを最も良くするものはどれか?
- RQ4部分シーケンスへのモデル適応は、低遅延環境下での性能向上にどの程度寄与するか?
- RQ5提案手法は、ASRや音声翻訳といった異なるシーケンス・ツー・シーケンスタスクに一般化可能か?
主な発見
- ローカルアヘンド戦略はASRで最良の遅延-品質トレードオフを達成し、オフライントランスクリプションと比較して0.8秒の遅延削減(1%絶対WER増加、6%相対)を実現した。
- 単方向モデルは、部分シーケンスへの適応後、How2 ASR データセットで14.4% WERを達成し、双方向モデルと同等の性能を示した。
- 適応後、単方向モデルはオフライン推論でも14.4% WERを維持しており、フルシーケンス性能が保持されていることを裏付けた。
- How2英語-ポルトガル語音声翻訳タスクでは、遅延を84%削減(0.7秒)し、相対BLEUスコアは5%低下(44.5から42.1)にとどまったが、オフラインシステムと比較して高い精度を維持した。
- ホールド-4およびローカルアヘンド戦略はホールド-0およびホールド-2を上回り、ローカルアヘンドはホールド-4と同等の品質を維持しながらより低い遅延を達成した。
- 部分シーケンスへの適応により、ASRでは誤差率が最大1%低下し、最大0.3秒の遅延増加を伴うが、出力制御の向上が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。