[论文解读] Pre-training in Deep Reinforcement Learning for Automatic Speech Recognition
本文提出通过预训练深度强化学习(DRL)智能体来实现自动语音命令识别,以加速收敛并提升准确率。通过使用监督语音识别模型的预训练特征初始化策略网络,DRL智能体在二分类、20类和30类分类任务中均实现了更快的学习速度和更高的最终性能,且在Speech Commands数据集上表现显著。
Deep reinforcement learning (deep RL) is a combination of deep learning with reinforcement learning principles to create efficient methods that can learn by interacting with its environment. This led to breakthroughs in many complex tasks that were previously difficult to solve. However, deep RL requires a large amount of training time that makes it difficult to use in various real-life applications like human-computer interaction (HCI). Therefore, in this paper, we study pre-training in deep RL to reduce the training time and improve the performance in speech recognition, a popular application of HCI. We achieve significantly improved performance in less time on a publicly available speech command recognition dataset.
研究动机与目标
- 解决深度强化学习(DRL)在语音识别中训练时间长、样本效率低的问题。
- 探究对DRL智能体的神经网络进行预训练是否能提升学习速度与最终准确率。
- 评估在低数据、高维音频分类任务中预训练的有效性。
- 证明预训练可实现DRL-based语音命令分类中更快的收敛与更好的泛化能力。
- 探索利用监督预训练来启动DRL智能体在音频处理中的可行性。
提出的方法
- 结合一维卷积层与LSTM循环层,以从MFCC中建模时间与频谱特征。
- 采用混合CNN-LSTM架构作为策略网络,后接全连接层与softmax输出用于分类。
- 在深度Q网络(DQN)框架中,将动作定义为预测的语音命令类别。
- 将状态空间定义为MFCC特征矩阵(n×f,n=40个MFCC,f=87帧),动作空间为可能命令的集合。
- 设计稀疏且形状化的奖励函数,对错误预测和延迟决策施加惩罚,以同时鼓励准确率与响应速度。
- 在微调强化学习前,使用同一数据集上的监督目标对CNN-LSTM主干网络进行预训练。
实验结果
研究问题
- RQ1在语音命令识别中,对DRL的策略网络进行预训练是否能缩短训练时间并提升收敛速度?
- RQ2预训练对低资源语音命令分类任务中DRL智能体的最终准确率有何影响?
- RQ3与随机初始化相比,预训练是否使性能在各训练回合中更稳定、波动更小?
- RQ4预训练对初始训练阶段学习速度有何影响?
- RQ5在相同DRL框架下,预训练是否能提升不同分类复杂度(二分类、20类、30类)下的性能?
主要发现
- 预训练显著缩短了达到高性能的时间:在二分类任务中,预训练使智能体在2,500轮以内即达到接近最大得分(49.0/50),而未预训练则需10,000轮。
- 在前1,000轮中,二分类任务的预训练版本得分提升速度提高了4.4%,表明学习动态更快。
- 在20类任务中,预训练使最终得分从-23.8提升至37.0(提升60.8%),展现出显著的性能增益。
- 在30类任务中,得分从-23.4提升至29.0,提升52.4%,表明其在更大分类问题中也具备可扩展性。
- 预训练场景下得分的标准差下降速度更快,表明策略学习随时间推移更稳定、更一致。
- 在所有三种分类场景中,预训练均实现了更快的收敛与更高的最终准确率,证实其在样本高效DRL语音识别中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。