Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning with Pre-training for Time-efficient Training of Automatic Speech Recognition

Thejan Rajapakshe, Siddique Latif|arXiv (Cornell University)|May 21, 2020
Speech Recognition and Synthesis参考文献 25被引用 11
一句话总结

本文提出了一种用于自动语音识别(ASR)中深度强化学习(DRL)的预训练策略,利用有监督的深度神经网络(DNN)来初始化策略网络。通过利用预训练特征,DRL智能体实现了显著更快的收敛速度和更高的准确性——在初始200个episode内最高提升21.11%,同时减少了训练时间,并在Speech Commands数据集上的多个ASR任务中提升了训练的一致性。

ABSTRACT

Deep reinforcement learning (deep RL) is a combination of deep learning with reinforcement learning principles to create efficient methods that can learn by interacting with its environment. This has led to breakthroughs in many complex tasks, such as playing the game "Go", that were previously difficult to solve. However, deep RL requires significant training time making it difficult to use in various real-life applications such as Human-Computer Interaction (HCI). In this paper, we study pre-training in deep RL to reduce the training time and improve the performance of Speech Recognition, a popular application of HCI. To evaluate the performance improvement in training we use the publicly available "Speech Command" dataset, which contains utterances of 30 command keywords spoken by 2,618 speakers. Results show that pre-training with deep RL offers faster convergence compared to non-pre-trained RL while achieving improved speech recognition accuracy.

研究动机与目标

  • 解决深度强化学习(DRL)在语音识别中训练时间长、数据需求高的问题。
  • 探究是否可通过有监督DNN权重预训练策略网络,以加速DRL训练并提升性能。
  • 评估预训练对ASR任务中收敛速度、准确率和训练一致性的影响力。
  • 证明在音频处理领域应用预训练于DRL的可行性,该领域相较于视觉或游戏领域仍属研究较少的领域。
  • 在二分类、20类和30类语音命令分类任务中,对预训练与非预训练DRL进行基准对比。

提出的方法

  • 使用80%的数据在Speech Commands数据集上对传统DNN进行有监督学习,采用随机梯度下降进行训练。
  • 利用学习到的DNN权重初始化DRL智能体中的策略网络,实现从有监督预训练到特征迁移。
  • 将语音命令识别任务建模为马尔可夫决策过程(MDP),包含状态空间S、动作空间A、转移策略P和奖励函数R。
  • 实现一个DRL框架,其中智能体根据观测选择动作,接收奖励,并使用Adam优化器更新策略网络。
  • 通过公式 H_i = η_correct / η 计算episode准确率,其中 η = 50 步/episode,最小化目标与预测动作之间的损失。
  • 使用目标网络通过最小化预测Q值与目标Q值之间的差异,以稳定训练并提升收敛性。

实验结果

研究问题

  • RQ1是否可通过有监督DNN权重预训练策略网络,减少语音命令识别中DRL所需的训练时间?
  • RQ2预训练是否能提升低数据、高维音频分类任务中DRL智能体的收敛速度与最终准确率?
  • RQ3预训练如何影响DRL训练的一致性与稳定性?以各episode准确率的标准差衡量。
  • RQ4预训练在多大程度上缩小了非预训练DRL与有监督基线在语音识别中的性能差距?
  • RQ5预训练的优势在Speech Commands数据集中不同分类复杂度(二分类、20类、30类)下是否保持一致?

主要发现

  • 预训练显著减少了达到高准确率所需的episode数量,二分类任务中200个episode后平均准确率提升21.11%。
  • 在10,000个episode后,预训练DRL智能体在二分类任务中达到100%准确率,优于非预训练智能体的80%准确率。
  • 在20类任务中,预训练使准确率从无预训练的25.71%提升至87.76%,提升62.04个百分点。
  • 在30类任务中,预训练智能体在10,000个episode后达到79.59%准确率,而非预训练版本仅为26.12%。
  • 预训练实验中准确率的标准差下降更快,表明训练一致性与稳定性得到提升。
  • 在前2,000个episode中,预训练智能体的准确率提升速率显著更高,证实了更快的学习动态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。