Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Spoken Language Understanding using RNN-Transducer ASR.

Anirudh Raju, Gautam Tiwari|arXiv (Cornell University)|Jun 30, 2021
Speech Recognition and Synthesis参考文献 31被引用数 5
ひとこと要約

本論文は、異なる微分可能ニューラルインターフェースを介して、再帰的ニューラルネットワーク変換器(RNNT)ASRモデルとニューラルNLUモデルを共同で訓練するエンドツーエンドのスプoken言語理解(SLU)システムを提案する。これにより、マルチタスク損失および意味的シーケンス損失を用いた統合的最適化が可能となり、公共および特許取得済みのSLUデータセットにおいて、パイプライン型ASR-NLUシステムおよび直接音声から意味を抽出するモデルを上回る性能を発揮する。ASRとNLUの両方の指標が統合的でエンドツーエンドの学習によって向上する。

ABSTRACT

We propose an end-to-end trained spoken language understanding (SLU) system that extracts transcripts, intents and slots from an input speech utterance. It consists of a streaming recurrent neural network transducer (RNNT) based automatic speech recognition (ASR) model connected to a neural natural language understanding (NLU) model through a neural interface. This interface allows for end-to-end training using multi-task RNNT and NLU losses. Additionally, we introduce semantic sequence loss training for the joint RNNT-NLU system that allows direct optimization of non-differentiable SLU metrics. This end-to-end SLU model paradigm can leverage state-of-the-art advancements and pretrained models in both ASR and NLU research communities, outperforming recently proposed direct speech-to-semantics models, and conventional pipelined ASR and NLU systems. We show that this method improves both ASR and NLU metrics on both public SLU datasets and large proprietary datasets.

研究の動機と目的

  • パイプライン型ASRとNLUシステムの限界、特に誤差伝搬と共同最適化の欠如を克服すること。
  • ASRとNLUモジュールを微分可能ニューラルインターフェースで統合することで、SLUのエンドツーエンド学習を可能にすること。
  • 非微分可能なSLU評価指標(例:意図認識精度、スロットF1)を直接最適化できるように、意味的シーケンス損失を導入することで、性能向上を図ること。
  • ASRおよびNLU分野における最先端の進展を統合し、統一されたフレームワーク内で事前学習済みモデルを活用すること。
  • 多様なSLUベンチマークにおいて、従来のパイプライン型システムおよび直接音声から意味を抽出するモデルを上回る優れた性能を示すこと。

提案手法

  • システムは、生の音声入力からトランスクリプトを生成するために、ストリーミング型再帰的ニューラルネットワーク変換器(RNNT)をASRコンポONENTとして使用する。
  • ニューラル自然言語理解(NLU)モデルは、RNNTが生成したトランスクリプトを処理し、意図とスロットラベルを予測する。
  • 微分可能ニューラルインターフェースがRNNTとNLUコンポONENTを接続し、両モジュールにわたるエンドツーエンドの誤差逆伝播を可能にする。
  • ASR(RNNT損失)とNLU(意図およびスロット予測の損失)の両方の損失を用いたマルチタスク学習により、両コンポonentの共同最適化を実現する。
  • 非微分可能なSLU評価指標(例:意図認識精度、スロットF1)を直接最適化できるように、意味的シーケンス損失を導入する。
  • ASR、NLU、意味的シーケンス損失の組み合わせを用いてエンドツーエンドでモデルを学習し、音声理解の統合的最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1ASRとNLUコンポonentを統合した共同エンドツーエンドSLUシステムは、ASRとNLUの両方の指標において、従来のパイプライン型ASR-NLUシステムを上回ることができるか?
  • RQ2ASRとNLUの間に微分可能ニューラルインターフェースを導入することで、効果的なエンドツーエンド学習と性能向上が達成できるか?
  • RQ3意味的シーケンス損失の導入により、非微分可能なSLU評価指標(例:意図認識精度、スロットF1)の最適化が向上するか?
  • RQ4共同モデルは、ASRおよびNLU研究コミュニティから得られる最先端の事前学習済みモデルをどの程度活用できるか?
  • RQ5提案されたエンドツーエンドパラダイムは、公共データセットおよび大規模な特許取得済みSLUデータセットの両方で、良好に一般化するか?

主な発見

  • 提案されたエンドツーエンドSLUシステムは、公共SLUデータセットにおいて、パイプライン型ASR-NLUシステムおよび直接音声から意味を抽出するモデルを上回る優れた性能を発揮する。
  • マルチタスク損失および意味的シーケンス損失を用いた共同学習により、ASRとNLUの両方の指標に顕著な向上が見られた。
  • 統一されたフレームワーク内に事前学習済みモデルを統合することで、ASRおよびNLU分野における最先端技術を効果的に活用した。
  • 意味的シーケンス損失により、非微分可能なSLU評価指標の直接最適化が可能となり、実世界の性能とより良い一致が達成された。
  • 本手法は、公共ベンチマークおよび大規模な特許取得済みデータセットの両方で一貫した向上を示し、優れた一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。