Skip to main content
QUICK REVIEW

[論文レビュー] Deep Neural Networks for Automatic Speech Processing: A Survey from Large Corpora to Limited Data

Vincent Roger, Jérôme Farinas|arXiv (Cornell University)|Mar 9, 2020
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本調査は、低リソースな自動音声処理における少数-shot学習技術を調査し、ASR、発話者識別、感情認識の低データ環境に焦点を当てる。グラフニューラルネットワークとメタラーニングフレームワークが1ショットで69.4%、10ショットで83.6%の正確度を達成しており、大規模データセットが入手できない障害者やレア言語向けの応用に有望である。

ABSTRACT

Most state-of-the-art speech systems are using Deep Neural Networks (DNNs). Those systems require a large amount of data to be learned. Hence, learning state-of-the-art frameworks on under-resourced speech languages/problems is a difficult task. Problems could be the limited amount of data for impaired speech. Furthermore, acquiring more data and/or expertise is time-consuming and expensive. In this paper we position ourselves for the following speech processing tasks: Automatic Speech Recognition, speaker identification and emotion recognition. To assess the problem of limited data, we firstly investigate state-of-the-art Automatic Speech Recognition systems as it represents the hardest tasks (due to the large variability in each language). Next, we provide an overview of techniques and tasks requiring fewer data. In the last section we investigate few-shot techniques as we interpret under-resourced speech as a few-shot problem. In that sense we propose an overview of few-shot techniques and perspectives of using such techniques for the focused speech problems in this survey. It occurs that the reviewed techniques are not well adapted for large datasets. Nevertheless, some promising results from the literature encourage the usage of such techniques for speech processing.

研究の動機と目的

  • 大規模なアノテート済みデータセットが入手できない状況、特に低リソース言語や病理的音声の文脈において、ディープニューラルネットワークを音声処理に適用する課題に対処すること。
  • データ増強、トランスファー学習、マルチタスク学習などの技術を調査し、限られた例でのモデル性能を向上させるためにデータ依存性を低減すること。
  • 特にグラフニューラルネットワークとメタラーニングを含む少数-shot学習フレームワークを検討し、低リソース音声タスクの有効な解決策とすること。
  • データ不足下でのリアルな音声タスク、たとえばASR、発話者識別、感情認識における少数-shot手法の実現可能性と性能を評価すること。
  • 今後の研究の有望な方向性を同定すること、具体的には少数-shotモデルのベンチマーク化と、言語理解度評価などの臨床的応用への応用を含む。

提案手法

  • LibriSpeech や TED-LIUM 3 といった大規模データセットで訓練された最先端のエンドツーエンドおよびハイブリッドASRシステムを調査し、性能のベースラインを確立する。
  • ドメイン適応、モデル蒸留、パラメータ効率的なファインチューニングなどのデータ効率の良い技術をレビューし、データ要件を低減する。
  • グラフニューラルネットワーク(GNN)を用いた少数-shot学習フレームワークを検討し、ノードがサポートサンプルおよびクエリサンプルを表し、隣接行列がアテンション機構を介して学習される。
  • 5ウェイエピソード設定を用いたGNNベースの少数-shot音声分類モデルを実装し、パラメータを学習するためにクエリセット上のクロスエントロピー損失を用いる。
  • グラフ畳み込み層におけるエッジ重みを計算するために、マルチレイヤーパーセプトロンを用いた可学習アテンション関数 $\phi(v_i^{(l)}, v_j^{(l)}) = f(|v_i^{(l)} - v_j^{(l)}|)$ を適用する。
  • Leaky ReLUを非線形関数 $\rho$ として用い、$Gc(V^{(l)}, A^{(l)}) = \rho(\sum_{B \in A} B V^{(l)} \theta_B^{(k,l)})$ によりグラフ畳み込みを実行し、ノード間で特徴を集約する。

実験結果

リサーチクエスチョン

  • RQ1少数-shot学習フレームワークは、ASR、発話者識別、感情認識といった低リソース音声処理タスクを効果的に処理できるか?
  • RQ21クラスあたり1〜10例のサンプルでのみ学習された場合、GNNベースの少数-shotモデルは音声分類でどの程度の性能を示すか?
  • RQ3LibriSpeech などの大ボリューム音声タスクに適用する場合、少数-shotモデルの計算的およびスケーラビリティの制限は何か?
  • RQ4少数-shot技術は、言語障害の検出など、データ収集が費用がかかり時間のかかる臨床的応用において、大規模なアノテート済みデータセットの必要性をどの程度低減できるか?
  • RQ5GNNにおけるアテンション機構は、グローバルアテンションやクラス内アテンションと比較して、少数-shot音声分類をどのように改善するか?

主な発見

  • GNNベースの少数-shotフレームワークは、AudioSetおよび[36]データセットで1ショットで69.4% ± 0.66、5ショットで78.3% ± 0.46、10ショットで83.6% ± 0.98の正確度を達成した。
  • クラス内アテンション機構は、グローバルアテンションを上回る性能を示し、クラス内での特徴の識別能が向上していることを示している。
  • 小規模タスクでは有望な結果を示したが、LibriSpeech などの大ボリュームASRタスクでは、SOTAモデルに比べて計算コストが高く、スケーラビリティに劣る。
  • ショット数を1から10に増やすことで性能向上が顕著に見られたため、わずか数例のラベル付きデータが存在する状況でも少数-shot学習が実用的であることが示唆された。
  • 少数-shot技術は、データ収集が困難で時間のかかる言語障害の検出などの臨床的および低リソース音声応用において、強く有望な可能性を示している。
  • 著者らは、今後の研究として少数-shotモデルの音声タスクにおけるベンチマーク化を提案し、最も性能の良いフレームワークを用いて言語理解度の概念を学習することを計画している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。