Skip to main content
QUICK REVIEW

[論文レビュー] Deep Graph Random Process for Relational-Thinking-Based Speech Recognition

Hengguan Huang, Fuzhao Xue|arXiv (Cornell University)|Jul 4, 2020
Speech Recognition and Synthesis被引用数 8
ひとこと要約

本稿では、音声認識における関係的知覚をモデル化するための無限の確率的グラフを生成するベイジアン非パrametric手法であるDeep Graph Random Process (DGP)を提案する。明示的な関係的教師信号を必要とせず、エンドツーエンドの関係的推論を可能にすることで、CHiME-2およびCHiME-5ベンチマークで最先端の性能を達成し、知覚的グラフの閉形式による結合と変換を通じて、騒音が強く会話的なASR環境でも高い耐性を示す。

ABSTRACT

Lying at the core of human intelligence, relational thinking is characterized by initially relying on innumerable unconscious percepts pertaining to relations between new sensory signals and prior knowledge, consequently becoming a recognizable concept or object through coupling and transformation of these percepts. Such mental processes are difficult to model in real-world problems such as in conversational automatic speech recognition (ASR), as the percepts (if they are modelled as graphs indicating relationships among utterances) are supposed to be innumerable and not directly observable. In this paper, we present a Bayesian nonparametric deep learning method called deep graph random process (DGP) that can generate an infinite number of probabilistic graphs representing percepts. We further provide a closed-form solution for coupling and transformation of these percept graphs for acoustic modeling. Our approach is able to successfully infer relations among utterances without using any relational data during training. Experimental evaluations on ASR tasks including CHiME-2 and CHiME-5 demonstrate the effectiveness and benefits of our method.

研究の動機と目的

  • 感覚的知覚を動的で関係的なグラフとして表現することで、音声認識における人間らしい関係的思考をモデル化すること。
  • ラベル付き関係データを必要とせず、現実世界のASRにおいて数えきれないほどの観察不能な知覚的関係をモデル化する課題に対処すること。
  • 音声モデルのエンドツーエンド学習を可能にするスケーラブルで微分可能なフレームワークを構築すること。
  • 知覚的グラフの効果的な結合と変換を可能にし、騒音が強く会話的な環境における音声認識を向上させること。

提案手法

  • 無限の階層的グラフ構造の知覚にベイジアン非パrametricな事前分布を適用し、関係的表現の無制限な生成を可能にする。
  • 知覚的グラフ生成を、ノードおよびエッジ上の確率過程を備えた深層ガウス過程として定式化し、不確実性と関係的構造を捉える。
  • 知覚的グラフの変換と結合に対して閉形式の解を導出することで、明示的な関係的教師信号なしに効率的なエンドツーエンド学習を可能にする。
  • メッセージパッシング機構を介してグラフベースの表現を音声モデルに統合し、発話間をまたがる関係的特徴を集約する。
  • 潜在的グラフ構造上の事後分布を近似するために変分推論を用いてエンドツーエンドで訓練する。
  • アプローチは、発話間の関係的依存関係をエンコードするグラフ構造を用いた、自動音声認識における系列モデルに適用される。

実験結果

リサーチクエスチョン

  • RQ1明示的な関係的教師信号なしに、関係的知覚の深層生成モデルが、騒音が強く会話的な環境における音声認識を改善できるか?
  • RQ2無限で非パrametricなグラフ過程を用いて、音声認識における観察不能で無意識的な知覚的関係をどのようにモデル化できるか?
  • RQ3グラフ結合による関係的推論が、現実世界のASRタスクにおける音声モデル性能に与える影響は何か?
  • RQ4グラフ変換の閉形式解が、ディープラーニングにおける効率的かつスケーラブルな関係的推論を可能にするか?
  • RQ5本モデルは、ノイズや話者構成が異なる多様な会話的音声シナリオにどのように一般化するか?

主な発見

  • 提案されたDGPモデルは、CHiME-2およびCHiME-5ベンチマークで最先端の性能を達成し、騒音が強く複数人参加の音声認識において強力なベースラインを上回った。
  • トレーニング時にいかなる関係的アノテーションも必要とせず、語誤り率(WER)に顕著な改善を示した。これは、教師なし関係的推論の有効性を裏付けている。
  • グラフ結合の閉形式解により、複雑なグラフ空間におけるサンプリングベースの推論を回避し、効率的で安定した学習が可能になった。
  • DGPのベイジアン非パrametricな性質により、入力データに応じて関係的表現の複雑さを自動的に調整でき、一般化性能が向上した。
  • アブレーションスタディにより、グラフ構造による関係的推論が環境ノイズや話者変動に対する耐性を顕著に向上させていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。