Skip to main content
QUICK REVIEW

[论文解读] Few-shot learning with attention-based sequence-to-sequence models

Bertrand Higy, Peter Bell|arXiv (Cornell University)|Nov 8, 2018
Domain Adaptation and Few-Shot Learning参考文献 20被引用 7
一句话总结

本文提出在低资源、小词汇量设置下,使用基于注意力的序列到序列模型进行少样本关键词识别。通过一种快速适应策略,仅使用每类10个少样本示例,模型达到了68.8%的准确率,优于微调策略,展现出在可访问、端到端语音命令系统中的强大潜力。

ABSTRACT

End-to-end approaches have recently become popular as a means of simplifying the training and deployment of speech recognition systems. However, they often require large amounts of data to perform well on large vocabulary tasks. With the aim of making end-to-end approaches usable by a broader range of researchers, we explore the potential to use end-to-end methods in small vocabulary contexts where smaller datasets may be used. A significant drawback of small-vocabulary systems is the difficulty of expanding the vocabulary beyond the original training samples -- therefore we also study strategies to extend the vocabulary with only few examples per new class (few-shot learning). Our results show that an attention-based encoder-decoder can be competitive against a strong baseline on a small vocabulary keyword classification task, reaching 97.5% of accuracy on Tensorflow's Speech Commands dataset. It also shows promising results on the few-shot learning problem where a simple strategy achieved 68.8\% of accuracy on new keywords with only 10 examples for each new class. This score goes up to 88.4\% with a larger set of 100 examples.

研究动机与目标

  • 评估端到端基于注意力的序列到序列模型在小词汇量关键词识别任务中的表现。
  • 通过支持少样本学习为新关键词引入新类,解决小数据系统中固定词汇表的限制。
  • 比较在极小数据量下,为新类别适应模型时,微调与重新训练策略的性能。
  • 评估端到端模型在传统系统可能表现不佳的低资源环境下的性能。
  • 探索在无需时间扭曲或隐马尔可夫模型(HMM)的情况下,使用任意长度输入的序列到序列模型在关键词检测中的可行性。

提出的方法

  • 采用编码器-解码器架构并结合加性注意力机制,实现端到端语音识别,输入为原始音频,输出为音素或字母音素序列。
  • 使用TensorFlow语音命令数据集中的固定长度音频片段,通过交叉熵损失进行模型训练。
  • 实施两种少样本学习策略:(1) 使用增强后的新增关键词样本从头开始重新训练;(2) 在预训练模型上对新类别进行微调,初始学习率降低。
  • 通过将新增关键词样本过采样至最多3000个,以在训练期间平衡类别频率。
  • 采用混合CTC/注意力机制以稳定训练过程,并改善输入与输出序列之间的对齐。
  • 通过在原始、未知及新增关键词上的分类误差进行性能评估,结果取10次随机运行的平均值以减少方差。

实验结果

研究问题

  • RQ1与强基准的DNN-HMM模型相比,端到端基于注意力的序列到序列模型在小词汇量关键词识别任务中是否能达到具有竞争力的性能?
  • RQ2当每类仅提供10个或100个样本时,简单的重新训练策略在少样本关键词学习中的有效性如何?
  • RQ3在少样本关键词识别中,快速微调(适应)策略是否在准确率和训练效率上优于重新训练?
  • RQ4当使用微调策略将模型适应新类别时,原始关键词的性能如何退化?
  • RQ5在数据有限的情况下,使用音素输出与字母音素输出对少样本学习性能有何影响?

主要发现

  • 基于注意力的序列到序列模型在原始语音命令数据集上达到了97.5%的准确率,优于强基准的DNN-HMM模型。
  • 重新训练策略在每类仅10个少样本时达到40.5%的准确率,在100个样本时达到81.5%,表明在极低数据环境下仍具可行性。
  • 微调(适应)策略在10个样本时达到68.8%的准确率,在100个样本时达到88.4%,显著优于重新训练,且训练速度更快。
  • 在适应过程中,随着学习率增加,原始关键词的性能出现下降,当发生过拟合时准确率急剧下降。
  • 在适应策略中使用音素或字母音素替换规则并未降低新关键词的性能,表明对输出表示选择具有鲁棒性。
  • 混合CTC/注意力机制在小词汇量任务中的训练动态与大词汇量自动语音识别任务不同,表明在低资源环境下存在独特行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。