[论文解读] An Investigation of Few-Shot Learning in Spoken Term Classification
本文提出了一种扩展的MAML框架用于少样本语音词项分类,通过引入新类(N)和固定类(M)(如静音和未知类)来提升泛化能力。在元训练过程中融合固定类的先验知识,该方法在10-shot命令分类任务上达到69.48%的准确率,优于传统的监督学习和原始MAML方法。
In this paper, we investigate the feasibility of applying few-shot learning algorithms to a speech task. We formulate a user-defined scenario of spoken term classification as a few-shot learning problem. In most few-shot learning studies, it is assumed that all the N classes are new in a N-way problem. We suggest that this assumption can be relaxed and define a N+M-way problem where N and M are the number of new classes and fixed classes respectively. We propose a modification to the Model-Agnostic Meta-Learning (MAML) algorithm to solve the problem. Experiments on the Google Speech Commands dataset show that our approach outperforms the conventional supervised learning approach and the original MAML.
研究动机与目标
- 探究将少样本学习应用于语音任务(特别是语音词项分类)的可行性。
- 通过引入现实的N+M路、K-shot问题设置,解决现有少样本学习方法假设所有类别均为新类的局限性。
- 在元学习过程中引入固定类(如静音、未知)的先验知识,提升用户自定义语音词项分类任务中的模型泛化能力。
- 评估少样本用户自定义系统在多大程度上可接近具备丰富训练数据的预定义系统的性能。
提出的方法
- 将语音词项分类建模为N+M路、K-shot少样本学习问题,其中N个新类别为用户自定义,M个固定类别(如静音、未知)预先已知。
- 修改模型无关元学习(MAML)算法,在元训练期间联合优化新类与固定类,使用共享的模型初始化。
- 采用含4个残差块的卷积神经网络(CNN)(每个残差块包含3×3卷积、ReLU激活函数和批量归一化)从1秒、16kHz的音频片段中提取特征。
- 使用30ms帧长和10ms帧移提取40维梅尔频率倒谱系数(MFCCs)作为输入表征。
- 采用元学习循环进行训练:从任务分布中采样任务,对支持集执行一步梯度更新,并利用查询集损失优化初始参数。
- 应用改进的MAML损失函数,在元更新过程中同时包含新类与固定类的预测,使模型能够快速适应新关键词,同时保留对固定类的知识。
实验结果
研究问题
- RQ1通过元学习实现的少样本学习能否有效应用于语音词项分类这一低资源语音任务?
- RQ2在元训练过程中引入固定类(如静音、未知)对少样本语音词项分类模型性能有何影响?
- RQ3少样本用户自定义语音词项分类系统在多大程度上可接近具备丰富训练数据的预定义系统的性能?
- RQ4所提出的扩展MAML框架是否在少样本设置下优于传统的监督微调和标准MAML?
主要发现
- 所提出的扩展MAML方法在10-shot命令分类任务上达到69.48%的准确率,显著优于原始MAML(57.34%)和监督学习(25.60%)。
- 在10-shot数字分类任务中,扩展MAML达到69.48%的准确率,而原始MAML为65.18%,监督学习为28.07%。
- 少样本系统与具备约3000个样本/类的预定义系统之间的性能差距仍然显著,少样本系统准确率为78.48%,而预定义系统为91%。
- 在元学习过程中使用固定类(如静音、未知)训练的模型泛化能力优于将所有类别视为新类的模型,证明了先验知识的优势。
- 相较于原始MAML的性能提升归因于固定类知识的使用,该知识稳定了元优化过程并提升了对新关键词的适应能力。
- 命令分类任务的性能始终低于数字分类任务,表明关键词复杂度和语音多样性会影响少样本学习的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。