[论文解读] Exploring speaker enrolment for few-shot personalisation in emotional vocalisation prediction
本文提出了一种用于情感语音化预测的 few-shot 个性化框架,采用一种新颖的 '注册' 编码器,通过使用目标说话人提供的两段未标注语音,利用点积注意力机制对情感编码器进行自适应。该方法在 ExVo Few-Shot 开发集上实现了 2.5% 的相对提升,达到 CCC 0.650,其中注册编码器对性能提升贡献最大,超过基线 CNN14 模型。
In this work, we explore a novel few-shot personalisation architecture for emotional vocalisation prediction. The core contribution is an `enrolment' encoder which utilises two unlabelled samples of the target speaker to adjust the output of the emotion encoder; the adjustment is based on dot-product attention, thus effectively functioning as a form of `soft' feature selection. The emotion and enrolment encoders are based on two standard audio architectures: CNN14 and CNN10. The two encoders are further guided to forget or learn auxiliary emotion and/or speaker information. Our best approach achieves a CCC of $.650$ on the ExVo Few-Shot dev set, a $2.5\%$ increase over our baseline CNN14 CCC of $.634$.
研究动机与目标
- 通过极少量说话人特定数据,提升情感语音化预测中的 few-shot 个性化性能。
- 探究如何利用目标说话人提供的两段未标注语音,实现情感识别模型的自适应。
- 探索辅助损失在引导注册编码器学习说话人特定表征、情感编码器学习情感不变表征方面的有效性。
- 评估通过注册编码器实现的注意力机制条件化是否优于标准的对抗性说话人不变基线方法。
提出的方法
- 模型采用双分支架构:情感编码器(CNN14)和注册编码器(CNN10),后者通过点积注意力机制对前者进行条件化。
- 注册编码器处理两段未标注的目标说话人语音,生成上下文向量,通过软注意力机制调制情感编码器的输出。
- 在两个编码器上分别应用辅助对抗性头:一个用于在情感编码器中抑制说话人身份,另一个用于增强注册编码器中的说话人表征。
- 使用梯度反转层并配合预热调度策略,逐步引入域不变性训练,提升模型鲁棒性。
- 最终预测由一个共享的情感分类器完成,其输入为经过注意力调制后的、说话人自适应的嵌入表示。
- 模型训练通过情感回归损失与辅助对抗性损失的组合进行优化,并对梯度反转超参数进行调优。
实验结果
研究问题
- RQ1在 few-shot 设置下,能否有效利用目标说话人提供的两段未标注语音,实现情感识别模型的个性化?
- RQ2通过注册编码器实现的注意力机制条件化是否优于标准的对抗性说话人不变技术?
- RQ3辅助对抗性头在提升个性化机制的泛化能力与鲁棒性方面有何贡献?
- RQ4不同组合的辅助损失对 ExVo Few-Shot 基准测试性能有何影响?
主要发现
- 所提出的基于注册的个性化方法在 ExVo Few-Shot 开发集上达到 CCC 0.650,相较于基线 CNN14 模型(0.634)实现 2.5% 的相对提升。
- 性能最高的架构为仅包含注册编码器、无额外辅助头的配置,表明核心机制提供了主要性能增益。
- 在情感编码器分支中添加对抗性说话人分类器会显著降低性能,表明在此场景下说话人不变性可能并无益处。
- 注册编码器配备对抗性情感分类器(但无说话人分类器)时,CCC 达到 0.647,相较于基线有微弱提升。
- 在注册编码器中同时添加两个对抗性头后,测试集上的 CCC 为 0.642,表明辅助指导的增益有限,主要贡献仍来自注册机制本身。
- 消融实验确认注册编码器是性能提升的主要驱动力,辅助组件仅带来边际改善。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。