Skip to main content
QUICK REVIEW

[论文解读] Neural Model Reprogramming with Similarity Based Mapping for Low-Resource Spoken Command Recognition

Hao Yen, Pin-Jui Ku|arXiv (Cornell University)|Oct 8, 2021
Speech Recognition and Synthesis参考文献 48被引用 5
一句话总结

本文提出了一种新颖的对抗性重编程(AR)框架,用于低资源语音命令识别(SCR),通过基于相似度的标签映射和迁移学习,将大规模英语声学模型适配至低资源语言(如立陶宛语、阿拉伯语及构音障碍普通话)。该方法在极少量标注数据下实现最先进性能,相较于现有方法,在构音障碍普通话上最高提升28.59%准确率,在阿拉伯语上达到98.9%准确率,同时保持高度稳定性。

ABSTRACT

In this study, we propose a novel adversarial reprogramming (AR) approach for low-resource spoken command recognition (SCR), and build an AR-SCR system. The AR procedure aims to modify the acoustic signals (from the target domain) to repurpose a pretrained SCR model (from the source domain). To solve the label mismatches between source and target domains, and further improve the stability of AR, we propose a novel similarity-based label mapping technique to align classes. In addition, the transfer learning (TL) technique is combined with the original AR process to improve the model adaptation capability. We evaluate the proposed AR-SCR system on three low-resource SCR datasets, including Arabic, Lithuanian, and dysarthric Mandarin speech. Experimental results show that with a pretrained AM trained on a large-scale English dataset, the proposed AR-SCR system outperforms the current state-of-the-art results on Arabic and Lithuanian speech commands datasets, with only a limited amount of training data.

研究动机与目标

  • 解决低资源语音命令识别中训练数据稀缺的挑战。
  • 在无需完整微调的情况下,实现预训练英语声学模型向低资源目标语言的有效迁移。
  • 通过新颖的标签对齐与迁移学习融合,提升低数据场景下的模型稳定性和性能。
  • 探究对抗性重编程在语音识别中超越计算机视觉的可行性与有效性。
  • 通过结合数据增强与迁移学习,展示AR方法的灵活性。

提出的方法

  • 引入一个重编程层,通过在输入语音信号中添加可学习噪声,以适应目标领域识别任务。
  • 采用基于相似度的标签映射技术,对齐源语言(英语)与目标语言(如立陶宛语、阿拉伯语)的类别分布,提升标签一致性。
  • 通过在AR生成的信号上微调预训练声学模型,将对抗性重编程与迁移学习相结合。
  • 采用两阶段训练流程:首先训练重编程层,生成能引导模型预测正确目标类别的噪声;其次,使用重编程后的数据对声学模型进行微调。
  • 在训练过程中应用SpecAugment作为数据增强手段,进一步提升模型鲁棒性与性能。
  • 通过聚合语义相似的源标签,将源模型预测的类别概率映射到目标类别。

实验结果

研究问题

  • RQ1对抗性重编程能否有效应用于低资源语音命令识别任务?
  • RQ2基于相似度的标签映射如何改善低资源SCR中源与目标类别空间之间的对齐?
  • RQ3将对抗性重编程与迁移学习结合,是否能获得优于单一方法的性能与稳定性?
  • RQ4对抗性重编程能否与数据增强有效结合,进一步提升低数据场景下的模型性能?
  • RQ5所提出的AR-SCR系统在低资源语音命令数据集上与最先进方法相比表现如何?

主要发现

  • 在立陶宛语语音命令数据集上,AR+TL系统在每关键词仅3个训练样本下达到70.2%准确率,显著优于Baseline+Aug(39.5%)与TL+Aug(65.9%),标准差仅为±2.72。
  • 在构音障碍普通话数据集上,AR+TL达到82.3%准确率,相较基线提升28.59%,且标准差为±2.56,表现出高度稳定性。
  • 在阿拉伯语数据集上,AR+TL达到98.9%准确率,超越最先进方法(98.13%),并优于单独的AR(94.8%)与TL(98.6%)组件。
  • 基于相似度的标签映射显著提升了性能,通过在不同领域间对齐语义相关的类别,尤其在低资源设置下效果显著。
  • 将AR与数据增强(SpecAugment)结合后,进一步增强了模型鲁棒性并降低了方差,证明了该方法的灵活性与可扩展性。
  • AR-SCR系统在所有三个低资源数据集(阿拉伯语、立陶宛语、构音障碍普通话)上均达到最先进性能,且重编程层仅包含16k可训练参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。