Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning with Pre-training for Time-efficient Training of Automatic Speech Recognition

Thejan Rajapakshe, Siddique Latif|arXiv (Cornell University)|May 21, 2020
Speech Recognition and Synthesis参考文献 25被引用数 11
ひとこと要約

本稿では、音声認識(ASR)における深層強化学習(DRL)のための事前学習戦略を提案する。教師ありDNNを用いて方策ネットワークを初期化することで、事前学習済み特徴を活用したDRLエージェントは、収束が著しく速く、精度が向上する。特に、最初の200エピソードで最大21.11%の向上が見られ、学習時間も短縮され、Speech Commandsデータセット上での複数のASRタスクにおいて一貫性が向上する。

ABSTRACT

Deep reinforcement learning (deep RL) is a combination of deep learning with reinforcement learning principles to create efficient methods that can learn by interacting with its environment. This has led to breakthroughs in many complex tasks, such as playing the game "Go", that were previously difficult to solve. However, deep RL requires significant training time making it difficult to use in various real-life applications such as Human-Computer Interaction (HCI). In this paper, we study pre-training in deep RL to reduce the training time and improve the performance of Speech Recognition, a popular application of HCI. To evaluate the performance improvement in training we use the publicly available "Speech Command" dataset, which contains utterances of 30 command keywords spoken by 2,618 speakers. Results show that pre-training with deep RL offers faster convergence compared to non-pre-trained RL while achieving improved speech recognition accuracy.

研究の動機と目的

  • 深層強化学習(DRL)が音声認識に適用される際の高コストな学習時間とデータ要件を解決すること。
  • 教師ありDNNの重みで方策ネットワークを事前学習することで、DRL学習の高速化と性能向上が可能かどうかを調査すること。
  • 事前学習がASRタスクにおける収束速度、精度、学習の一貫性に与える影響を評価すること。
  • 音声処理分野においては視覚やゲーム分野と比較して未だあまり研究が進んでいない分野であるが、DRLにおける事前学習の実現可能性を示すこと。
  • 二値分類、20クラス分類、30クラス分類の音声コマンド分類タスクにおいて、事前学習と非事前学習DRLをベンチマークすること。

提案手法

  • Stochastic Gradient Descentを用いて、Speech Commandsデータセットの80%のデータを教師あり学習で使用し、従来のDNNを事前学習する。
  • 学習済みDNNの重みを用いて、DRLエージェントの方策ネットワークを初期化し、教師あり事前学習からの特徴転送を実現する。
  • 状態空間S、行動空間A、遷移方策P、報酬関数Rを有するマーカフ連鎖過程(MDP)として音声コマンド認識タスクを定式化する。
  • エージェントが観測に基づいて行動を選択し、報酬を受け取り、Adam最適化法を用いて方策ネットワークを更新するDRLフレームワークを実装する。
  • H_i = η_correct / η(η = エピソードあたり50ステップ)を用いてエピソード精度を計算し、ターゲットと予測行動の損失を最小化する。
  • 予測Q値とターゲットQ値の差を最小化することで、訓練の安定化と収束の向上を図るため、ターゲットネットワークを用いる。

実験結果

リサーチクエスチョン

  • RQ1教師ありDNNの重みで方策ネットワークを事前学習することで、音声コマンド認識における深層強化学習の学習に要する時間を短縮できるか?
  • RQ2事前学習は、低データ・高次元音声分類タスクにおけるDRLエージェントの収束速度と最終的精度を向上させるか?
  • RQ3標準誤差を用いてエピソードごとの精度のばらつきを測定した場合、事前学習はDRL学習の一貫性と安定性にどのように影響するか?
  • RQ4事前学習は、非事前学習DRLと教師ありベースラインとの間の性能格差をどれほど縮小できるか?
  • RQ5事前学習の利点は、Speech Commandsデータセットにおける分類の複雑さ(二値、20クラス、30クラス)にかかわらず一貫しているか?

主な発見

  • 事前学習により、高い精度に到達するためのエピソード数が減少し、二値分類タスクでは200エピソード後の平均精度が21.11%向上した。
  • 10,000エピソード経過後、事前学習済みDRLエージェントは二値タスクで100%の精度を達成したのに対し、非事前学習エージェントは80%にとどまった。
  • 20クラスタスクでは、事前学習なし(w/o)で25.71%、事前学習あり(w/)で87.76%に向上し、62.04ポイントの向上を達成した。
  • 30クラスタスクでは、事前学習済みエージェントが10,000エピソードで79.59%の精度を達成したのに対し、非事前学習バージョンは26.12%であった。
  • 事前学習実験では、精度の標準偏差がより速く減少し、学習の一貫性と安定性の向上が示された。
  • 事前学習エージェントでは、最初の2,000エピソードにおける精度向上の割合が著しく高く、より速い学習ダイナミクスが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。