Skip to main content
QUICK REVIEW

[论文解读] WaveTransformer: A Novel Architecture for Audio Captioning Based on Learning Temporal and Time-Frequency Information

An Cong Tran, Konstantinos Drossos|arXiv (Cornell University)|Oct 21, 2020
Music and Audio Processing参考文献 21被引用 9
一句话总结

WaveTransformer 提出了一种新颖的音频字幕生成架构,通过专用的一维空洞卷积和二维CNN,显式建模音频中的时间模式与时频模式,随后采用可学习的融合模块。该方法在Clotho数据集上实现了最先进性能,使用束搜索时SPIDEr达到18.2,超越了此前无需数据增强或多任务学习的方法。

ABSTRACT

Automated audio captioning (AAC) is a novel task, where a method takes as an input an audio sample and outputs a textual description (i.e. a caption) of its contents. Most AAC methods are adapted from from image captioning of machine translation fields. In this work we present a novel AAC novel method, explicitly focused on the exploitation of the temporal and time-frequency patterns in audio. We employ three learnable processes for audio encoding, two for extracting the local and temporal information, and one to merge the output of the previous two processes. To generate the caption, we employ the widely used Transformer decoder. We assess our method utilizing the freely available splits of Clotho dataset. Our results increase previously reported highest SPIDEr to 17.3, from 16.2.

研究动机与目标

  • 开发一种深度学习架构,用于自动音频字幕生成,显式捕捉音频中的时间模式与时频模式。
  • 通过可学习的融合机制,融合局部、时间与频谱表征,提升字幕质量。
  • 仅使用公开可用的划分数据集,在无需数据增强或多任务学习的情况下,实现在Clotho数据集上的最先进性能。
  • 分析时间模式、时频模式与融合表征对字幕生成性能的单独与联合贡献。

提出的方法

  • 模型采用三分支编码器:一个分支使用一维空洞卷积(受WaveNet启发)以学习长程时间依赖,另一个分支使用二维CNN提取时频模式,第三个分支用于融合前两者的输出。
  • 时间编码器(E_temp)使用堆叠的wave-block,每个block包含七个一维卷积,具有不同的卷积核大小、空洞率与感受野,以捕捉分层时间特征。
  • 时频编码器(E_tf)处理对数梅尔频谱图,利用二维CNN学习局部频谱模式与声音事件。
  • 融合模块(E_merge)通过逐元素相加或拼接后接前馈层,将E_temp与E_tf的特征进行融合,生成统一的音频表征。
  • 解码器为标准的Transformer解码器,采用多头注意力机制,从融合后的音频表征中自回归地生成字幕。
  • 推理阶段使用束搜索以提升生成质量,显著提高SPIDEr得分。

实验结果

研究问题

  • RQ1时间模式与时频模式表征对音频字幕生成性能的独立贡献如何?
  • RQ2通过可学习方式融合时间与时频特征,是否能超越单独使用任一模态的性能?
  • RQ3所提出的WaveTransformer架构是否在无需数据增强或多任务学习的情况下,实现在Clotho数据集上的最先进性能?
  • RQ4不同组件(E_temp、E_tf、E_merge)如何影响模型描述物体、属性与时空关系的能力?

主要发现

  • WaveTransformer在Clotho评估划分上使用束搜索,实现了18.2的全新最先进SPIDEr得分,超越了此前的最先进方法。
  • 仅使用时频编码器(WT_tf)的性能优于时间编码器(WT_temp),表明频谱图模式对识别声音事件至关重要。
  • 通过E_merge模块融合时间与时频特征后,性能显著提升,尤其在SPICE与CIDEr得分上,表明对物体属性与关系的建模更优。
  • 完整WaveTransformer模型(WT)在标准划分上实现17.3的SPIDEr得分,优于此前最先进方法的16.2。
  • 束搜索带来显著性能提升,使SPIDEr从17.3提升至18.2,证明其在提升字幕质量方面的有效性。
  • 该模型在无需数据增强的条件下优于NTT,在无需多任务学习的条件下优于TRACKE,证实其优越性不依赖外部正则化技术。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。