Skip to main content
QUICK REVIEW

[論文レビュー] Turning Whisper into Real-Time Transcription System

Dominik Macháček, Raj Dabre|arXiv (Cornell University)|Jul 27, 2023
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本稿では、ローカルアテネーションストリーミングポリシーと自己適応型遅延を用いて、オフラインのWhisper ASRモデルに基づくリアルタイム音声字下げおよび翻訳システムであるWhisper-Streamingを提示する。英語の長文音声において平均3.3秒の遅延を達成し、高い品質を維持しており、ライブの多言語会議環境における耐障害性と実用性を示している。

ABSTRACT

Whisper is one of the recent state-of-the-art multilingual speech recognition and translation models, however, it is not designed for real time transcription. In this paper, we build on top of Whisper and create Whisper-Streaming, an implementation of real-time speech transcription and translation of Whisper-like models. Whisper-Streaming uses local agreement policy with self-adaptive latency to enable streaming transcription. We show that Whisper-Streaming achieves high quality and 3.3 seconds latency on unsegmented long-form speech transcription test set, and we demonstrate its robustness and practical usability as a component in live transcription service at a multilingual conference.

研究の動機と目的

  • オフラインのWhisper ASRモデルを用いて、リアルタイムで低遅延の音声字下げおよび翻訳を実現すること。
  • 実用的な遅延制約下でも高い字下げ品質を維持するストリーミング推論パイプラインの実装と評価を行うこと。
  • 本システムの耐障害性と実用性を、実世界の多言語会議環境において実証すること。
  • 産業および学術用途向けに、公開可能でプロダクション運用に耐える実装を提供すること。
  • 将来的なリアルタイム多言語音声処理分野の研究における強固なベースラインを確立すること。

提案手法

  • ローカルアテネーションアルゴリズムを用いて、同時に字下げを可能にするストリーミング推論パイプラインをWhisperモデルに拡張する。
  • 字下げ出力の信頼性に基づいて動的に調整される自己適応型遅延メカニズムを適用する。
  • GPU上で効率的かつ低遅延な推論を実現するため、faster-whisper推論エンジンとCTranslate2を用いる。
  • 分散型で複数の音声ソースと複数のターゲット言語を処理可能なリアルタイムの字下げおよび翻訳を実現するため、ELITRフレームワークにサーバー部を統合する。
  • ストリーミング同期と信頼性推定を支援するため、基本となるWhisperモデルからの単語レベルのタイムス탬プと句読点を活用する。
  • 音声をチャンク単位で処理するバッファベースの処理モデルを採用し、確認済みの出力セグメントはロックされ、未確認セグメントは時間経過とともに精練される。
Figure 1: Illustration of processing three consecutive updates. The yellow highlighted text is a “prompt”, the previous context to follow. The black-bordered rectangle is an audio buffer, and the text inside is Whisper’s transcript generated from that sound segment. The blue vertical line is a times
Figure 1: Illustration of processing three consecutive updates. The yellow highlighted text is a “prompt”, the previous context to follow. The black-bordered rectangle is an audio buffer, and the text inside is Whisper’s transcript generated from that sound segment. The blue vertical line is a times

実験結果

リサーチクエスチョン

  • RQ1オフラインのWhisper ASRモデルを、品質を損なわせることなくリアルタイムで低遅延の字下げに効果的に適応できるか?
  • RQ2ローカルアテネーションストリーミングポリシーは、大規模で多言語の音声認識タスクに適用された場合、どの程度の性能を示すか?
  • RQ3長文でセグメンテーションのない音声に対して、ストリーミングベースのWhisperシステムで達成可能な遅延と語誤り率(WER)はどの程度か?
  • RQ4実世界の多言語ライブ字下げシナリオにおいて、システムの耐障害性はどの程度か?
  • RQ5本システムは、生産運用に耐える分散型音声処理パイプラインに信頼性高く統合可能か?

主な発見

  • NVIDIA A40 GPUを用いた英語のESICテストセットにおいて、Whisper-Streamingは計算負荷を考慮した遅延を伴いながらも平均3.3秒の遅延を達成した。
  • システムは高い字下げ品質を示し、英語トラックでは2.35%のWERを達成し、オフラインのWhisper性能と同等であった。
  • ドイツ語とチェコ語では、0.5秒の遅延でそれぞれ10.2%および12.3%のWERを達成し、優れた多言語一般化性能を示した。
  • ライブの多言語会議での実装において、英語、チェコ語、ウクライナ語の音声すべてにおいて、適切な遅延と高い品質を維持しながら耐障害性と信頼性を示した。
  • ELITRフレームワークとの統合により、複数の言語ストリームのリアルタイム分散処理が可能となり、ASRおよび音声翻訳の両方をサポートした。
  • Whisper-Streamingのオープンソース提供により、リアルタイム多言語音声処理分野におけるプロダクション運用に耐えるベースラインが提供された。
Figure 2: Impact of VAD filter on latency and quality. The striking difference in VAD activated or deactivated for English vs German is due to German being the speech of an interpreter.
Figure 2: Impact of VAD filter on latency and quality. The striking difference in VAD activated or deactivated for English vs German is due to German being the speech of an interpreter.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。