Skip to main content
QUICK REVIEW

[论文解读] Interactive Audio-text Representation for Automated Audio Captioning with Contrastive Learning

Chen Chen, Nana Hou|arXiv (Cornell University)|Mar 29, 2022
Music and Audio Processing被引用 9
一句话总结

该论文提出 CLIP-AAC,一种新颖的自动音频字幕模型,通过在预训练编码器中联合编码音频和文本,利用音频头和文本头学习交互式跨模态表征。通过应用对比学习对齐音频和文本嵌入,CLIP-AAC 在 Clotho 数据集上实现了最先进性能,在所有 NLP 评估指标上均优于强基线模型,且在预训练和对比微调方面均取得显著提升。

ABSTRACT

Automated Audio captioning (AAC) is a cross-modal task that generates natural language to describe the content of input audio. Most prior works usually extract single-modality acoustic features and are therefore sub-optimal for the cross-modal decoding task. In this work, we propose a novel AAC system called CLIP-AAC to learn interactive cross-modality representation with both acoustic and textual information. Specifically, the proposed CLIP-AAC introduces an audio-head and a text-head in the pre-trained encoder to extract audio-text information. Furthermore, we also apply contrastive learning to narrow the domain difference by learning the correspondence between the audio signal and its paired captions. Experimental results show that the proposed CLIP-AAC approach surpasses the best baseline by a significant margin on the Clotho dataset in terms of NLP evaluation metrics. The ablation study indicates that both the pre-trained model and contrastive learning contribute to the performance gain of the AAC model.

研究动机与目标

  • 解决现有自动音频字幕(AAC)模型仅依赖单模态声学特征导致的次优性能问题。
  • 通过在编码过程中同时利用两种模态来学习交互式表征,改善音频与文本之间的跨模态对齐。
  • 通过对比学习提升特征质量与音频和字幕输入之间的语义对应关系。
  • 展示具有双头编码器的预训练音频-文本模型在自动音频字幕任务中的有效性,特别是在低监督设置下。

提出的方法

  • CLIP-AAC 模型采用双头编码器结构,包含基于 ESResNeXt 的音频头和 12 层 Transformer 的文本头,从配对输入中提取联合音频-文本嵌入。
  • 音频输入被转换为对数功率谱图,并通过 2D 卷积和双路径残差块提取深层声学特征。
  • 文本输入被分词并嵌入,随后通过带层归一化的 12 层 Transformer 编码器生成上下文感知的文本表征。
  • 模型应用对比学习损失 $L_{cl}$ 对正样本音频-文本对进行对齐,同时将负样本对推开,使用可学习系数 $\alpha$ 平衡对比损失与交叉熵损失。
  • 推理阶段,文本头被丢弃,仅音频头将特征输入解码器以生成字幕。
  • 编码器初始化自 AudioCLIP,并在 Clotho 数据集上通过对比学习和自回归监督进行微调。

实验结果

研究问题

  • RQ1采用双头编码器架构,联合处理音频和文本,能否提升自动音频字幕任务中的跨模态表征学习?
  • RQ2音频和文本嵌入之间的对比学习如何影响音频字幕模型的性能?
  • RQ3在大规模音频-文本数据上进行预训练,能在多大程度上提升下游数据集上的零样本或少样本字幕生成性能?
  • RQ4预训练模型与对比微调对 AAC 总体性能提升的相对贡献分别是什么?

主要发现

  • CLIP-AAC 在 Clotho 数据集上达到最先进性能,所有评估指标(BLEU-n、METEOR、ROUGE-L、CIDEr、SPICE 和 SPIDEr)均优于最佳基线模型。
  • 消融实验表明,使用 AudioCLIP 初始化编码器并同时微调音频头和文本头,相比随机初始化或仅音频初始化,能带来显著性能提升。
  • 对比学习组件有效提升性能,最优结果在对比损失系数 $\alpha = 0.2$ 时取得。
  • 将批量大小增加至 16 可通过提升对比学习中负样本对的多样性而改善性能。
  • 余弦相似度矩阵的可视化结果表明,对比学习在训练后显著增强了真实音频-文本对之间的对齐程度。
  • 结果表明,结合对比优化的联合音频-文本编码可生成更具语义对齐性与鲁棒性的跨模态嵌入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。