[論文レビュー] Audio-visual Recognition of Overlapped speech for the LRS2 dataset
本稿では、ゲート付き融合機構を備えたハイブリッドLF-MMI時間遅延ニューラルネットワーク(TDNN)アーキテクチャを用いて、重なった発話に対する新しい音声・映像語りかけ認識(AVSR)システムを提案する。LRS2データセットにおいて最先端の性能を達成し、音声のみのベースラインと比較して語彙誤り率(WER)を最大29.98%絶対値低下させ、より複雑なパイプライン型システムと同等の性能を達成した。
Automatic recognition of overlapped speech remains a highly challenging task to date. Motivated by the bimodal nature of human speech perception, this paper investigates the use of audio-visual technologies for overlapped speech recognition. Three issues associated with the construction of audio-visual speech recognition (AVSR) systems are addressed. First, the basic architecture designs i.e. end-to-end and hybrid of AVSR systems are investigated. Second, purposefully designed modality fusion gates are used to robustly integrate the audio and visual features. Third, in contrast to a traditional pipelined architecture containing explicit speech separation and recognition components, a streamlined and integrated AVSR system optimized consistently using the lattice-free MMI (LF-MMI) discriminative criterion is also proposed. The proposed LF-MMI time-delay neural network (TDNN) system establishes the state-of-the-art for the LRS2 dataset. Experiments on overlapped speech simulated from the LRS2 dataset suggest the proposed AVSR system outperformed the audio only baseline LF-MMI DNN system by up to 29.98\% absolute in word error rate (WER) reduction, and produced recognition performance comparable to a more complex pipelined system. Consistent performance improvements of 4.89\% absolute in WER reduction over the baseline AVSR system using feature fusion are also obtained.
研究の動機と目的
- 音声干渉が顕著に性能を低下させる重なった発話状況における自動語りかけ認識の課題に対処すること。
- 音声・映像統合が、音声劣化を緩和する視覚的手がかりを活用することで、重なった発話における認識の耐障害性を向上させることを調査すること。
- ラティスフリーMMI(LF-MMI)基準を用いて、音声強調と認識を統合的に最適化する、統合型AVSRシステムを開発し、パイプライン型アーキテクチャの制限を回避すること。
- ハイブリッド型とエンドツーエンド型AVSRアーキテクチャを比較し、重なった発話認識に優れた設計を同定すること。
- 変動する信頼性条件下での音声・映像統合を動的に適応させる新しいゲート付き融合機構を導入・評価すること。
提案手法
- クリーンな発話および重なった発話データの両方を用いてエンドツーエンドに訓練される、ハイブリッドLF-MMI TDNNアーキテクチャをAVSRに採用し、判別的語りかけ認識性能を最適化する。
- 2つのゲート付き融合機構を導入:視覚モダリティ駆動型(V ⊗ A)および音声・視覚モダリティ駆動型(AV ⊗ A)、それぞれがモダリティの信頼性に基づいて音声および視覚特徴の重みを動的に設定する。
- 信頼性の低い視覚入力を抑制するように学習するゲート付き融合層を導入し、視覚品質が低下した場合の耐障害性を向上させる。
- シーケンスレベルの判別的訓練のため、ラティスフリーMMI(LF-MMI)基準を適用し、明示的な音声分離部品を含めない統合型AVSRシステムを統合的に最適化する。
- SNRレベル(-5dB から 10dB)を変化させたクリーン発話と2発話重なった発話データの混合を用いて訓練し、現実的なノイズ環境を模擬する。
- 分離済み(分離済み)データとクリーンデータの両方を用いた多条件訓練を実施する、分離と認識モジュールが別々のパイプライン型アーキテクチャと、提案された統合型システムを比較する。
実験結果
リサーチクエスチョン
- RQ1LRS2データセットにおいて、ハイブリッド型AVSRシステムはエンドツーエンド型AVSRシステムを上回る性能を示すか?
- RQ2ゲート付き融合機構は、従来の特徴連結統合と比較して、視覚入力の信頼性が低い状況でもAVSR性能を向上させるか?
- RQ3LF-MMIで訓練された統合型AVSRシステムは、明示的な音声分離と多条件訓練を用いる複雑なパイプライン型システムと同等の性能を達成できるか?
- RQ4視覚モダリティの導入は、特にSNRが低い状況下でWER低下に寄与するか?
- RQ5分離と認識のコンponentを別々に最適化するのと比較して、LF-MMIによる統合的最適化は認識の耐障害性をどの程度向上させるか?
主な発見
- 提案されたLF-MMI TDNNハイブリッドAVSRシステムは、LRS2データセットで最先端の性能を達成し、以前のエンドツーエンド型AVSRシステムを上回った。
- ゲート付き融合機構(AV ⊗ A)は、特徴連結統合と比較して、WERを4.89%絶対値低下(相対値32%)させ、モダリティ劣化に対する耐障害性が向上したことを示した。
- 統合型AVSRシステムは、音声のみのLF-MMI DNNベースラインと比較して、WERを最大29.98%絶対値低下させ、顕著に優れた性能を示した。
- 最良の性能を示した統合型システムは、SNRレベルの範囲で平均WERが10.80%を記録し、多条件訓練を用いたより複雑なパイプライン型システムと同等の性能を達成した。
- 音声フレームレベルのアライメントを用いて訓練された視覚のみのシステムは、性能が向上しており、音声の監視が唇読みモデルの性能を向上させることを示唆している。
- ハイブリッド型AVSRシステムはLRS2においてエンドツーエンド型AVSRシステムを上回った。これは、ハイブリッドアーキテクチャが複雑な重なり発話認識タスクに適している可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。