Skip to main content
QUICK REVIEW

[論文レビュー] Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition

Thejan Rajapakshe, Rajib Rana|arXiv (Cornell University)|Oct 24, 2019
Music and Audio Processing参考文献 19被引用数 5
ひとこと要約

本論文は、収束を加速し、精度を向上させるために、自動音声コマンド認識のための深層強化学習(DRL)エージェントの事前学習を提案する。教師付き音声認識モデルからの事前学習済み特徴量で方策ネットワークを初期化することにより、二値分類、20クラス分類、30クラス分類の各タスクにおいて、Speech Commands Dataset上でのDRLエージェントが著しく高速な学習と高い最終的性能を達成する。

ABSTRACT

Deep reinforcement learning (deep RL) is a combination of deep learning with reinforcement learning principles to create efficient methods that can learn by interacting with its environment. This led to breakthroughs in many complex tasks that were previously difficult to solve. However, deep RL requires a large amount of training time that makes it difficult to use in various real-life applications like human-computer interaction (HCI). Therefore, in this paper, we study pre-training in deep RL to reduce the training time and improve the performance in speech recognition, a popular application of HCI. We achieve significantly improved performance in less time on a publicly available speech command recognition dataset.

研究の動機と目的

  • 音声認識における深層強化学習(DRL)の長時間の学習とデータ非効率性を解決すること。
  • DRLエージェントのニューラルネットワークを事前学習することで、学習速度と最終的精度が向上するかを調査すること。
  • 低データ、高次元音声分類タスクにおける事前学習の有効性を評価すること。
  • 事前学習がDRLベースの音声コマンド分類における収束の高速化とより良い一般化を可能にすることを実証すること。
  • 教師付き事前学習を用いてDRLエージェントを音声処理タスクでブートストラップする可能性を検討すること。

提案手法

  • MFCCから時間的およびスペクトル的特徴を抽出するため、1次元畳み込み層とLSTM再帰層を組み合わせる。
  • 方策ネットワークとしてハイブリッドCNN-LSTMアーキテクチャを採用し、その後に全結合層とソフトマックス出力を設ける。
  • 行動が予測された音声コマンドクラスに対応する深層Qネットワーク(DQN)フレームワークを実装する。
  • 状態空間をMFCC特徴行列(n×f、n=40 MFCC、f=87フレーム)として定義し、行動空間を可能なコマンドの集合とする。
  • 誤った予測と遅延した意思決定をペナルティとして課すスパarsな形状付けられた報酬関数を設計し、精度と速度の両方を促進する。
  • 強化学習による微調整の前に、同じデータセット上で教師付き目的を用いてCNN-LSTMバックボーンを事前学習する。

実験結果

リサーチクエスチョン

  • RQ1DRLにおける方策ネットワークの事前学習が、音声コマンド認識における学習時間の短縮と収束速度の向上に寄与するか?
  • RQ2事前学習が低リソース音声コマンド分類タスクにおけるDRLエージェントの最終的精度に与える影響は?
  • RQ3ランダム初期化と比較して、事前学習がエピソード間でより安定した、かつばらつきの少ない性能をもたらすか?
  • RQ4事前学習が初期学習段階における学習速度に与える影響は?
  • RQ5同じDRLフレームワーク内において、二値分類、20クラス分類、30クラス分類の各複雑さの分類問題において、事前学習が性能向上に寄与するか?

主な発見

  • 事前学習により、高い性能に到達するまでの時間が短縮された:二値タスクでは、事前学習ありで2,500エピソード未満で最大得点(49.0/50)に達したのに対し、なしでは10,000エピソードを要した。
  • 二値タスクにおいて、事前学習ありでは最初の1,000エピソードでスコア向上速度が4.4%向上し、より速い学習ダイナミクスを示した。
  • 20クラスタスクでは、最終スコアが-23.8から37.0に向上(60.8%の向上)、顕著な性能向上を示した。
  • 30クラスタスクでは、スコアが-23.4から29.0に向上(52.4%の向上)、より大きな分類問題へのスケーラビリティを示した。
  • スコアの標準偏差が、事前学習ありのシナリオでより速く減少し、時間経過とともにより安定的かつ一貫性のある方策学習が実現した。
  • すべての3つの分類シナリオにおいて、事前学習が収束の高速化とより高い最終的精度をもたらし、音声認識におけるデータ効率の良いDRLにおける有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。