Skip to main content
QUICK REVIEW

[论文解读] CTAL: Pre-training Cross-modal Transformer for Audio-and-Language Representations

Hang Li, Yu Kang|arXiv (Cornell University)|Sep 1, 2021
Speech Recognition and Synthesis参考文献 44被引用 5
一句话总结

CTAL 提出了一种用于音频与语言表征的跨模态 Transformer 预训练框架,通过大规模音频-语言配对数据进行掩码语言建模和掩码跨模态声学建模,联合学习模态内与模态间依赖关系,并引入一种新颖的正交融合机制,在微调阶段增强特征互补性,从而在情感分类、情感分析和说话人验证任务中取得最先进性能。

ABSTRACT

Existing audio-language task-specific predictive approaches focus on building complicated late-fusion mechanisms. However, these models are facing challenges of overfitting with limited labels and low model generalization abilities. In this paper, we present a Cross-modal Transformer for Audio-and-Language, i.e., CTAL, which aims to learn the intra-modality and inter-modality connections between audio and language through two proxy tasks on a large amount of audio-and-language pairs: masked language modeling and masked cross-modal acoustic modeling. After fine-tuning our pre-trained model on multiple downstream audio-and-language tasks, we observe significant improvements across various tasks, such as, emotion classification, sentiment analysis, and speaker verification. On this basis, we further propose a specially-designed fusion mechanism that can be used in fine-tuning phase, which allows our pre-trained model to achieve better performance. Lastly, we demonstrate detailed ablation studies to prove that both our novel cross-modality fusion component and audio-language pre-training methods significantly contribute to the promising results.

研究动机与目标

  • 为解决任务特定的晚期融合模型在有限标注数据下存在过拟合和泛化能力差的问题。
  • 开发一种通用的、可预训练的音频与语言表征模型,以捕捉模态内与模态间依赖关系。
  • 通过在大规模音频-语言配对数据上进行联合预训练,提升下游语音理解任务的性能。
  • 设计一种在微调阶段专用的融合机制,以促进模态特定的正交特征学习,从而实现更好的表征互补性。
  • 通过全面的消融实验验证预训练组件与融合机制的有效性。

提出的方法

  • 采用多流 Transformer 主干网络,其中语言流处理文本标记,文本参考的音频流处理梅尔频谱图和语言嵌入。
  • 采用两种代理预训练任务:掩码语言建模(MLM)和掩码跨模态声学建模(MCAM),以学习联合表征。
  • 在微调阶段引入模态正交正则化项,确保音频与语言特征从不同且非冗余的角度贡献。
  • 提出一种非对称编码器设计,使音频流同时关注声学特征和语言流嵌入,以实现跨模态对齐。
  • 使用所提出的正交融合机制在下游任务上微调预训练模型,以增强特征多样性与性能。
  • 利用大规模音频-语言配对数据进行预训练,并通过消融实验隔离各组件的贡献。

实验结果

研究问题

  • RQ1在音频-语言配对数据上进行联合预训练是否能提升下游语音理解任务的表征学习能力?
  • RQ2掩码语言建模与掩码跨模态声学建模在跨模态表征学习中分别起到什么作用?
  • RQ3在微调阶段采用专用融合机制是否能通过促进正交互补的特征学习来提升性能?
  • RQ4预训练组件(如 MLM 和 MCAM)对最终模型性能的贡献程度如何?
  • RQ5CTAL 在多模态任务中与单模态预训练基线模型(如 RoBERTa、Mockingjay)相比表现如何?

主要发现

  • 在情感分类任务中,CTAL 在 IEMOCAP 数据集上达到 0.8055 的准确率和 0.0155 的 EER,表现最先进。
  • 在情感分析任务中,CTAL-LARGE 在 IEMOCAP 数据集上取得 0.8077 的 F1 分数和 0.8101 的准确率,优于先前方法。
  • 在说话人验证任务中,CTAL-LARGE 的 EER 达到 0.0155,显著低于基线 RoBERTa(0.0320)及其他模型。
  • 消融实验表明,若在预训练阶段移除 MLM 或 MCAM,所有任务的性能均出现显著下降,证明二者联合重要性。
  • 当移除正交融合机制后,EER 下降 1.5–2%,F1 下降 1–2%,证实其有效性。
  • 使用更大规模数据(如 LibriTTS)进行预训练可提升性能,且 CTAL-LARGE 在所有指标上均优于 CTAL-BASE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。