Skip to main content
QUICK REVIEW

[论文解读] Improved Conformer-based End-to-End Speech Recognition Using Neural Architecture Search

Yukun Liu, Li Ta|arXiv (Cornell University)|Apr 12, 2021
Speech Recognition and Synthesis参考文献 31被引用 8
一句话总结

该论文提出了一种可微神经架构搜索(DARTS)框架,以自动发现针对特定数据集的改进型基于Conformer的端到端自动语音识别模型。通过在多头自注意力、卷积和前馈模块上扩展灵活的搜索空间,并应用动态搜索调度(DSS)正则化策略,该方法在AISHELL-1数据集上相比人工设计的基线模型实现了11%的相对CER提升,同时保持了较低的搜索成本。

ABSTRACT

Recently neural architecture search(NAS) has been successfully used in image classification, natural language processing, and automatic speech recognition(ASR) tasks for finding the state-of-the-art(SOTA) architectures than those human-designed architectures. NAS can derive a SOTA and data-specific architecture over validation data from a pre-defined search space with a search algorithm. Inspired by the success of NAS in ASR tasks, we propose a NAS-based ASR framework containing one search space and one differentiable search algorithm called Differentiable Architecture Search(DARTS). Our search space follows the convolution-augmented transformer(Conformer) backbone, which is a more expressive ASR architecture than those used in existing NAS-based ASR frameworks. To improve the performance of our method, a regulation method called Dynamic Search Schedule(DSS) is employed. On a widely used Mandarin benchmark AISHELL-1, our best-searched architecture outperforms the baseline Conform model significantly with about 11% CER relative improvement, and our method is proved to be pretty efficient by the search cost comparisons.

研究动机与目标

  • 解决固定的人工设计Conformer模块可能无法在特定数据集上达到最优性能的局限性。
  • 探究神经架构搜索(NAS)是否能够发现超越标准Conformer配置的、更优的、数据特定的架构。
  • 通过利用可微神经架构搜索(DARTS),降低现有NAS方法在自动语音识别中较高的计算成本。
  • 通过一种新颖的正则化策略——动态搜索调度(DSS),提升搜索性能,增强泛化能力和收敛性。
  • 在大规模普通话自动语音识别基准(AISHELL-1)上验证所提NAS框架的效率与有效性。

提出的方法

  • 基于Conformer架构设计搜索空间,使每个模块可独立从多头自注意力(MHSA)、卷积(Conv)和前馈网络(FFN)的多种操作中进行选择。
  • 采用可微神经架构搜索(DARTS)作为搜索算法,通过连续松弛化搜索空间,实现基于梯度的架构参数优化。
  • 引入动态搜索调度(DSS),一种正则化技术,可在训练过程中动态调整架构学习率,以提升稳定性和性能。
  • 训练一个单一的超网络,联合优化模型权重与架构参数,仅通过一次完整训练即可实现高效的架构搜索。
  • 所有实验均使用单张Nvidia Titan RTX,超参数包括学习率预热步数(25,000)、初始峰值学习率(1.0)、标签平滑(0.1)和dropout率(0.1),DSS中β设为2.0。
  • 通过在AISHELL-1数据集上从头开始重新训练最终架构,确保与基线模型的公平比较。

实验结果

研究问题

  • RQ1在AISHELL-1基准上,神经架构搜索能否发现比标准人工设计架构更高效、更适配数据的基于Conformer的架构?
  • RQ2与强化学习或进化算法等传统NAS方法相比,DARTS是否显著降低了自动语音识别中的搜索成本?
  • RQ3动态搜索调度(DSS)正则化在提升所搜索架构的性能与稳定性方面效果如何?
  • RQ4所提出的NAS框架能否在与基线Conformer模型相当的模型规模下,实现更优的自动语音识别性能?
  • RQ5搜索过程中涌现出的架构模式是什么?这些模式是否与语音模型表征学习中的已知原理一致?

主要发现

  • 通过DARTS结合DSS搜索到的最佳架构在AISHELL-1测试集上实现了11%的相对CER提升,CER从8.3%降低至7.5%。
  • DARTS结合DSS在开发集上达到6.7%的CER,在测试集上达到7.5%的CER,优于基线Conformer模型以及无DSS的DARTS方法。
  • DARTS结合DSS的搜索成本为23.2小时,显著低于随机搜索所需的322小时,且与基线模型的重新训练时间(21.6小时)相当。
  • 与随机搜索相比,基于DARTS的方法将搜索成本降低了90%以上,证明了其在复杂搜索空间下的高效率。
  • 所搜索到的架构在不同模块中采用了多样的操作组合,表现为深层模块中MHSA头数从16减少至4,后期卷积层使用更大的卷积核,表明存在分层特征学习机制。
  • FFN模块始终选择最大的隐藏维度(1024),表明隐藏维度是影响性能的关键因素,更大的容量更有利于提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。