Skip to main content
QUICK REVIEW

[论文解读] Improving the Performance of Automated Audio Captioning via Integrating the Acoustic and Semantic Information

Zhongjie Ye, Helin Wang|arXiv (Cornell University)|Oct 12, 2021
Music and Audio Processing参考文献 22被引用 11
一句话总结

本文提出 MAAC,一种多模态音频字幕模型,通过新颖的多模态注意力机制,将卷积神经网络编码器提取的声学特征与预训练关键词编码器提供的语义信息以及先前生成的词语相结合。该模型在 Clotho 数据集上实现了最先进性能,经 CIDEr-D 优化后,CIDEr-D 分数从 41.9 提升至 49.1。

ABSTRACT

Automated audio captioning (AAC) has developed rapidly in recent years, involving acoustic signal processing and natural language processing to generate human-readable sentences for audio clips. The current models are generally based on the neural encoder-decoder architecture, and their decoder mainly uses acoustic information that is extracted from the CNN-based encoder. However, they have ignored semantic information that could help the AAC model to generate meaningful descriptions. This paper proposes a novel approach for automated audio captioning based on incorporating semantic and acoustic information. Specifically, our audio captioning model consists of two sub-modules. (1) The pre-trained keyword encoder utilizes pre-trained ResNet38 to initialize its parameters, and then it is trained by extracted keywords as labels. (2) The multi-modal attention decoder adopts an LSTM-based decoder that contains semantic and acoustic attention modules. Experiments demonstrate that our proposed model achieves state-of-the-art performance on the Clotho dataset. Our code can be found at https://github.com/WangHelin1997/DCASE2021_Task6_PKU

研究动机与目标

  • 解决现有自动音频字幕(AAC)模型仅依赖声学特征、忽略语义上下文的局限性。
  • 通过在解码过程中引入关键词等语义信息以及先前预测的词语,提升字幕质量。
  • 设计一种多模态注意力机制,实现在句子生成过程中有效融合声学与语义特征。
  • 通过交叉熵损失与强化学习的联合优化,在 Clotho 数据集上实现最先进性能。
  • 通过消融研究验证语义信息在提升字幕质量方面的有效性。

提出的方法

  • 基于 ResNet38 的预训练关键词编码器,使用从真实字幕中的名词和动词提取的多热向量标签进行微调。
  • 关键词编码器被训练以从字幕中检测显著的音频概念(例如 'bird'、'chirp'),提供语义监督。
  • 基于 LSTM 的解码器集成一个多模态注意力模块,该模块同时关注声学特征(来自 CNN 编码器)和语义特征(关键词及前一解码步骤的隐藏状态)。
  • 多模态注意力机制通过查询、键和值投影,融合声学与语义表征,计算上下文向量。
  • 整个模型分两个阶段训练:首先在冻结关键词编码器的情况下使用交叉熵损失进行训练,然后使用强化学习(PPO)进行微调,以 CIDEr-D 作为奖励信号。
  • 应用数据增强技术,如 SpecAugment、Mixup、标签平滑和教师强制,以提升模型的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1将关键词和先前预测词语的语义信息整合,能否提升音频字幕的质量?
  • RQ2所提出的多模态注意力机制相较于标准注意力机制,在字幕生成性能上有何差异?
  • RQ3在注意力机制中,语义特征(关键词)与先前预测词语的贡献分别是什么?
  • RQ4在不同注意力头之间共享语义注意力模块是否能提升性能?
  • RQ5融合预训练的语义与声学表征,能否在 Clotho 数据集上实现最先进结果?

主要发现

  • 经过 CIDEr-D 优化后,所提出的 MAAC 模型在 Clotho 数据集上达到 49.1 的 CIDEr-D 分数,显著优于之前的最先进模型。
  • 消融研究显示,仅在语义注意力模块中使用先前预测词语的影响微乎其微,可能由于错误预测导致的误差传播。
  • 仅依赖关键词进行语义注意力的模型无法收敛,表明仅靠关键词会破坏语义关系的建模。
  • 融合关键词与先前预测词语的多模态注意力机制表现最佳,证明二者具有互补作用。
  • 在不同注意力头之间共享语义注意力模块可进一步提升 CIDEr-D 分数,表明参数共享具有架构优势。
  • 可视化结果证实,模型在解码过程中能以情境感知的方式动态关注相关语义概念(如 'birds' 和 'chirping')。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。