Skip to main content
QUICK REVIEW

[論文レビュー] Multiresolution and Multimodal Speech Recognition with Transformers

Georgios Paraskevopoulos, Srinivas Parthasarathy|arXiv (Cornell University)|Apr 29, 2020
Speech and Audio Processing参考文献 28被引用数 7
ひとこと要約

本稿では、視覚的特徴をクロスモーダルアテンションを用いて融合することでASR性能を向上させるTransformerベースの音声視覚連合音声認識システムを提案する。また、文字レベルおよびサブワードレベルの書き出しを同時に最適化するマルチスケールトレーニング方式を採用する。How2データセットにおける実験結果から、視覚入力により相対的に3.76% WERが改善され、マルチスケールトレーニングにより相対的に18.3% WERが低減され、単一スケールモデルと比較して収束が50%速くなることが示された。

ABSTRACT

This paper presents an audio visual automatic speech recognition (AV-ASR) system using a Transformer-based architecture. We particularly focus on the scene context provided by the visual information, to ground the ASR. We extract representations for audio features in the encoder layers of the transformer and fuse video features using an additional crossmodal multihead attention layer. Additionally, we incorporate a multitask training criterion for multiresolution ASR, where we train the model to generate both character and subword level transcriptions. Experimental results on the How2 dataset, indicate that multiresolution training can speed up convergence by around 50% and relatively improves word error rate (WER) performance by upto 18% over subword prediction models. Further, incorporating visual information improves performance with relative gains upto 3.76% over audio only models. Our results are comparable to state-of-the-art Listen, Attend and Spell-based architectures.

研究の動機と目的

  • 音声視覚連合音声認識システムを、Transformerを用いて視覚的文脈を活用することで音声認識性能を向上させるエンドツーエンドの手法を開発すること。
  • 現実世界の制約のある環境において、視覚的特徴を用いたマルチモーダルな文脈化の有効性を検証すること。
  • 文字レベルとサブワードレベルの書き出しを同時に最適化するマルチスケール損失を用いたトレーニング方式の有効性を評価し、モデルの正則化を図ること。
  • 視覚入力が欠落している、または劣化している状況下でもモデルの頑健性を評価すること。
  • WERと収束速度の観点から、提案手法を最先端のListen, Attend and Spellベースのアーキテクチャと比較すること。

提案手法

  • モデルは音声特徴を処理するためのTransformerエンコーダを用い、視覚的特徴を音声特徴空間に投影するためにクロスモーダルスケーリングドットプロダクトアテンション層を適用する。
  • 視覚的特徴と音声特徴はスカラ加法的融合により統合され、その後デコーダに供給され、シーケンス生成が行われる。
  • サブワードレベルと文字レベルの交差エントロピー損失を統合したマルチタスク損失を用いてモデルの正則化を図り、一般化性能を向上させる。
  • 入力音声シーケンスはフレームスタッキングによりダウンサンプリングされ、自己注意機構の二次的記憶複雑度を軽減する。
  • システムはHow2データセット上で音声と映像の両方の入力を用いてエンドツーエンドでトレーニングされ、視覚入力が欠落した状況での性能を評価するアブレーションスタディが実施される。
  • 視覚的特徴表現はResNeXtベースのバックボーンネットワークを用いて抽出され、推論時において視覚入力はゲート処理されたり、ノイズに置き換えられたりして、モデルの頑健性をテストする。

実験結果

リサーチクエスチョン

  • RQ1現実世界の制約のある環境において、視覚的特徴を用いたマルチモーダルな文脈化によってASR性能が向上するか?
  • RQ2サブワードレベルと文字レベルの両方の書き出しをマルチスケール損失で同時に最適化することで、一般化性能が向上し、収束が早くなるか?
  • RQ3視覚入力が欠落している、または劣化している場合、モデルは再トレーニングなしで頑健性を維持できるか?
  • RQ4提案されたクロスモーダルアテンションによる特徴融合機構は、既存のマルチモーダルTransformerアーキテクチャと比較してASR性能で優れているか?
  • RQ5マルチスケールトレーニングは、単一スケールのサブワードまたは文字レベルモデルと比較して、どの程度WERを低減するか?

主な発見

  • クロスモーダルアテンションを用いた視覚的特徴の統合により、How2データセット上での音声のみモデルと比較して相対的に3.76% WERが改善された。
  • マルチスケールトレーニング方式により、サブワードのみのモデルと比較して相対的に18.3% WERが低減され、強い正則化効果が示された。
  • マルチスケール監視のもとでトレーニングされたモデルは、単一スケールモデルと比較して約50%速く収束した。
  • フレームスタッキングによる入力ダウンサンプリングは、コンテキスト情報を長距離にわたって保持する点で、チャンクングを上回る性能を示した。
  • 視覚入力が欠落した場合、AV-ASRモデルは音声のみモデルと比較して約6%相対的に性能が低下したが、視覚特徴がガウスノイズ(σ=0.2)に置き換えられた場合に最も高い性能を示した。
  • 明示的な発音情報に依存しないにもかかわらず、提案手法は最先端のListen, Attend and Spellベースのモデルと同等の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。