[論文レビュー] WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit
WeNetは、CTCとアテンションデコードを組み合わせた新規の2パスU2アーキテクチャを採用することで、ストリーミングおよび非ストリーミングASRを統合したプロダクション対応でオープンソースのエンドツーエンド音声認識ツールキットです。AISHELL-1で相対的にCERを5.03%低減し、PyTorchおよびTorchScriptを介してサーバーおよびエッジデバイスの両方で最適化されたランタイムを提供することで低レイテンシ推論を実現しています。
In this paper, we propose an open source, production first, and production ready speech recognition toolkit called WeNet in which a new two-pass approach is implemented to unify streaming and non-streaming end-to-end (E2E) speech recognition in a single model. The main motivation of WeNet is to close the gap between the research and the production of E2E speechrecognition models. WeNet provides an efficient way to ship ASR applications in several real-world scenarios, which is the main difference and advantage to other open source E2E speech recognition toolkits. In our toolkit, a new two-pass method is implemented. Our method propose a dynamic chunk-based attention strategy of the the transformer layers to allow arbitrary right context length modifies in hybrid CTC/attention architecture. The inference latency could be easily controlled by only changing the chunk size. The CTC hypotheses are then rescored by the attention decoder to get the final result. Our experiments on the AISHELL-1 dataset using WeNet show that, our model achieves 5.03\% relative character error rate (CER) reduction in non-streaming ASR compared to a standard non-streaming transformer. After model quantification, our model perform reasonable RTF and latency.
研究の動機と目的
- エンドツーエンド(E2E)音声認識モデルの研究とプロダクションデプロイのギャップを埋める。
- 開発、トレーニング、デプロイコストを削減するため、1つのモデルでストリーミングおよび非ストリーミングASRを統合する。
- サーバーおよびエッジデバイスを含む多様なハードウェアプラットフォームで効率的かつ低レイテンシの推論を可能にする。
- PyTorchおよびTorchScriptを用いて、研究用トレーニングからプロダクション推論へのスムーズな移行を提供する。
- 量子化、ダイナミックチャンク、プラットフォーム間のランタイムポータビリティを活用してモデル効率を最適化する。
提案手法
- U2フレームワークの提案:共有エンコーダ(TransformerまたはConformer)、CTCデコーダ、アテンションデコーダを備えた2パス共同CTC/アテンションモデル。
- 動的チャンクに基づく自己アテンションを採用し、可変長の受容野を許容することで、ストリーミング推論を可能にする。
- 2パスデコード戦略を採用:第1パスでCTCデコードによりストリーミング仮説を生成し、第2パスでアテンションデコードにより再スコアリングと精度向上を実現。
- 共有エンコーダが入力を右側の制限付きコンテキストで処理するハイブリッドCTC/アテンションアーキテクチャを採用し、レイテンシとパフォーマンスのバランスを図る。
- 因果的畳み込みを用いた動的チャンクトレーニングにより、ストリーミングをサポートしながらもグローバルコンテキストモデリングを維持する。
- TorchScriptを介したモデルエクスポートと、LibTorch、ONNX、OpenVINO、MNN、NCNNなどの複数のランタイムでのデプロイをサポートし、クロスプラットフォーム互換性を実現。

実験結果
リサーチクエスチョン
- RQ1統一されたE2Eモデルは、別々のモデルトレーニングを必要とせずに、ストリーミングおよび非ストリーミングASRの両方で高い精度を達成できるか?
- RQ2動的チャンキングとアテンション機構をどのように組み合わせれば、低レイテンシを維持しながら認識精度を保てるか?
- RQ3CTCとアテンションデコードを備えた1つのモデルが、実世界のデプロイ環境においてレイテンシを低減し、推論効率を向上させられる程度はどの程度か?
- RQ42パス再スコアリング機構は、標準の非ストリーミングモデルと比較して文字誤り率(CER)にどのような影響を与えるか?
- RQ5モデルの量子化とランタイム最適化が、リアルタイム要因(RTF)およびエンドツーエンドレイテンシに与える影響は何か?
主な発見
- U2モデルは、標準の非ストリーミングTransformerモデルと比較して、AISHELL-1データセットで相対的にCERを5.03%低減した。
- 15,000時間の中国語データセットを用いた実験では、U2モデルはAISHELL-1で3.70%のCERを達成し、フルアテンションデコードを用いたフルアテンションConformerベースライン(3.96%)を上回った。
- x86サーバープラットフォームにおける最終レイテンシ(L3)は、デコードチャンクサイズが4の場合130msであり、主に再スコアリングコスト(L2)の約114msが支配的である。
- 再スコアリングコストは異なるチャンクサイズにかかわらずほぼ一定であり、レイテンシ低減には第2パスのアテンションデコードの最適化が焦点となることが示された。
- 16フレームのチャンクサイズでもCERに顕著な低下がなく、低レイテンシでの実用的デプロイを支援する。
- ツールキットは、TorchScriptを介したトレーニング済みモデルの直接エクスポートを可能にし、x86およびARMプラットフォームへのデプロイをサポートしており、プロダクション対応であることを実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。