Skip to main content
QUICK REVIEW

[論文レビュー] Thank you for Attention: A survey on Attention-based Artificial Neural Networks for Automatic Speech Recognition

Priyabrata Karmakar, Shyh Wei Teng|arXiv (Cornell University)|Feb 14, 2021
Speech Recognition and Synthesis参考文献 76被引用数 11
ひとこと要約

本調査は、オフラインおよびストリーミングASRの両方を対象として、自動音声認識(ASR)における注目メカニズムに基づくニューラルネットワークの包括的分析を提供する。RNNおよびTransformerベースのアーキテクチャを網羅し、グローバル注目、ローカル注目、コンテンツベース注目、ロケーションベース注目、ハイブリッド注目メカニズムの進化を詳細に記述するとともに、ストリーミングに適した変種として、チャンクフロー、時間制限付き自己注意、モノトニック注目といった手法を検討し、性能を維持したままリアルタイム推論を可能にする。

ABSTRACT

Attention is a very popular and effective mechanism in artificial neural network-based sequence-to-sequence models. In this survey paper, a comprehensive review of the different attention models used in developing automatic speech recognition systems is provided. The paper focuses on the development and evolution of attention models for offline and streaming speech recognition within recurrent neural network- and Transformer- based architectures.

研究の動機と目的

  • エンドツーエンドの自動音声認識(ASR)システムにおける注目メカニズムの体系的レビューを提供すること。
  • 再帰ニューラルネットワーク(RNN)ベースおよびTransformerベースのASRアーキテクチャにおける注目モデルの進化を分析すること。
  • チャンキングや制限された注目範囲を含む、注目メカニズムを用いたストリーミングASRを可能にする技術を検討すること。
  • アライメント学習の非効率性や注目ヘッドの冗長性といったオンラインASRにおける課題を特定し、提案された解決策をレビューすること。
  • 広範な自然言語処理(NLP)の調査とは異なり、ASRにおける注目メカニズムに特化した包括的かつ焦点を絞った調査を提供することで、既存の文献におけるギャップを埋めること。

提案手法

  • 注目計算および範囲に基づき、グローバル/ソフト、ローカル/ハード、コンテンツベース、ロケーションベース、ハイブリッドのタイプに注目メカニズムを分類する。
  • 自己注意がTransformerベースのASRで再帰性を置き換え、並列処理を可能にする役割を説明する。
  • チャンクフロー機構(式21)のようなストリーミング対応変種を詳細に記述し、固定長の入力ウィンドウ(例:Nl=20, Nr=10)に自己注意を制限する。
  • 時間制限付き自己注意を説明し、左および右に固定フレーム数(例:15フレームと6フレーム)に注目を制限することで、リアルタイム推論を可能にする。
  • 同期型Transformerとモノトニックトリンケートド注目を提示し、注目を左コンテキストのみに制限し、チャンク単位で処理する。
  • 冗長なヘッドをマスキングし、効果的な学習を促すことで、アライメント学習を改善するHeadDrop正則化およびプルーニング技術を導入する。

実験結果

リサーチクエスチョン

  • RQ1グローバル注目、ローカル注目、コンテンツベース注目、ロケーションベース注目、ハイブリッド注目といった異なるタイプの注目メカニズムは、RNNおよびTransformerベースのASRモデルでどのように進化し、応用されてきたか?
  • RQ2ストリーミング(オンライン)音声認識に適応させるために、注目メカニズムに必要な主なアーキテクチャ的およびトレーニング上の変更は何か?
  • RQ3チャンクフロー、時間制限付き注目、モノトニック注目といった技術は、性能を維持したままリアルタイムASRをどのように可能にするか?
  • RQ4多ヘッド注目に伴うオンラインASRにおける課題は何か?HeadDropやプルーニングといった手法はそれらをどのように解決するか?
  • RQ5Transformerにおける自己注意メカニズムは、ASRの系列モデルにおいて再帰性の制限をどのように克服するか?

主な発見

  • チャンクフロー機構は、自己注意を固定ウィンドウ(例:左20フレーム、右10フレーム)に制限することで、限定的なコンテキストであっても、許容できる性能でストリーミング推論を可能にする。
  • 時間制限付き自己注意は、左に15フレーム、右に6フレームに注目を制限し、最小限の性能低下でリアルタイム推論を達成する。
  • モノトニックマルチヘッド注目(MMA)は、各ヘッドが左から右への位置のみに注目するように制限することで、オンラインデコードを可能にするが、アライメント学習に有効なのは一部のヘッド(優勢なヘッド)に限られる。
  • HeadDrop正則化は、一部の注目ヘッドをランダムにマスキングすることで、残りのヘッドがより効果的に学習し、冗長性を低減する。
  • 低層部の冗長なMAヘッドをプルーニングすることで、注目ヘッド間の協調性が向上し、オンラインASRにおける推論効率が向上する。
  • 同期型Transformerとチャンクベースの自己注意は、重複するチャンクで符号化されたフレームを処理し、注目を左コンテキストのみに制限することで、ストリーミングを可能にし、完全な系列依存性を回避する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。