Skip to main content
QUICK REVIEW

[论文解读] DARTS-ASR: Differentiable Architecture Search for Multilingual Speech Recognition and Adaptation

Yi‐Chen Chen, Jui-Yang Hsu|arXiv (Cornell University)|May 13, 2020
Speech Recognition and Synthesis参考文献 30被引用 13
一句话总结

本文提出 DARTS-ASR,一种可微架构搜索框架,用于在多语言和单语言语音识别中联合优化神经网络架构与模型权重。通过在连续架构空间中进行基于梯度的搜索,DARTS-ASR 在 IARPA BABEL 数据集上分别相对于固定拓扑基线模型,在单语言和多语言设置下实现了 10.2% 和 10.0% 的相对字符错误率(CER)降低。

ABSTRACT

In previous works, only parameter weights of ASR models are optimized under fixed-topology architecture. However, the design of successful model architecture has always relied on human experience and intuition. Besides, many hyperparameters related to model architecture need to be manually tuned. Therefore in this paper, we propose an ASR approach with efficient gradient-based architecture search, DARTS-ASR. In order to examine the generalizability of DARTS-ASR, we apply our approach not only on many languages to perform monolingual ASR, but also on a multilingual ASR setting. Following previous works, we conducted experiments on a multilingual dataset, IARPA BABEL. The experiment results show that our approach outperformed the baseline fixed-topology architecture by 10.2% and 10.0% relative reduction on character error rates under monolingual and multilingual ASR settings respectively. Furthermore, we perform some analysis on the searched architectures by DARTS-ASR.

研究动机与目标

  • 为了在自动语音识别(ASR)中实现神经架构设计的自动化,减少对人工经验与手动超参数调优的依赖。
  • 为了将可微架构搜索(DARTS)扩展至多语言 ASR,实现在多种语言间联合优化架构与权重。
  • 为了评估 DARTS-ASR 是否能够发现泛化能力强、性能优越的架构,使其在单语言和多语言设置下均优于人工设计的模型。

提出的方法

  • 搜索空间被定义为一个具有 K 个节点的有向无环图(DAG),其中每个节点代表一个特征图,边代表来自集合 𝔽(例如,3x3 卷积、MaxPool2d、跳跃连接)的可学习操作。
  • 通过使用 softmax 加权门控对架构操作进行可微松弛:g_{i,j}(H_j) = Σ_f exp(α_f^{i,j}) / Σ_f' exp(α_f'^{i,j}) × f(H_j),从而实现基于梯度的优化。
  • 采用双流优化策略训练模型:架构参数 α 和网络权重 θ 在验证集上通过梯度下降法联合更新。
  • 对于多语言 ASR,模型在源语言上进行预训练,并通过三种策略在目标语言上进行微调:仅微调参数、同时微调架构与参数,或剪枝并微调架构。
  • 最终架构基于每条边的前三个操作(α 值最高)进行选择,从而在几乎不损失性能的前提下实现高效推理。
  • 该框架在 IARPA BABEL 多语言 ASR 数据集上进行评估,与 VGG-Small、VGG-Large 及固定拓扑基线模型进行对比。

实验结果

研究问题

  • RQ1可微架构搜索(DARTS)能否有效应用于多语言自动语音识别,以发现优于人工设计的架构?
  • RQ2DARTS-ASR 所发现的架构是否能在多语言 ASR 中跨多种低资源语言实现泛化?
  • RQ3在单语言和多语言设置下,通过 DARTS-ASR 实现的架构与权重联合优化,相较于标准的固定架构微调,在字符错误率(CER)方面表现如何?
  • RQ4在单语言和多语言 ASR 中,DARTS-ASR 所发现的架构模式是什么?它们在不同语言之间有何差异?
  • RQ5从 DARTS-ASR 中提取的剪枝架构是否能在降低计算成本的同时保持性能?

主要发现

  • 在 IARPA BABEL 数据集的单语言 ASR 中,DARTS-ASR 相较于固定拓扑基线模型实现了 10.2% 的相对字符错误率(CER)降低。
  • 在多语言 ASR 中,DARTS-ASR 相较于同一基线模型实现了 10.0% 的相对 CER 降低,表明其在跨语言场景下具有强大的泛化能力。
  • 'Adapt arch.+param.' 微调策略表现最佳,而 'Adapt only param.' 和 'Adapt pruned arch.+param.' 略有逊色,表明方法具有鲁棒性,并具备显著的效率潜力。
  • 多语言 ASR 所搜索到的架构在不同语言间高度相似,尤其是在深层网络中,表明通过联合预训练可涌现出一种共享的、通用的架构。
  • 在单语言 ASR 中,不同语言的架构存在显著差异(例如,越南语与斯瓦希里语相似,而泰米尔语与库尔曼吉语则截然不同),反映出语言特定的优化特性。
  • 剪枝后的架构在降低复杂度的同时保持了强劲的性能,表明 DARTS-ASR 能够在几乎不损失准确率的前提下实现高效的模型压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。