Skip to main content
QUICK REVIEW

[论文解读] Audio-aware Query-enhanced Transformer for Audio-Visual Segmentation

Jinxiang Liu, Chen Ju|arXiv (Cornell University)|Jul 25, 2023
Speech and Audio Processing被引用 5
一句话总结

本文提出了一种新型多模态Transformer框架——音频感知查询增强Transformer(AuTR),用于音视频分割。该方法在解码器中引入音频感知可学习查询,以聚焦于发声物体,同时抑制静默但显著的物体。通过利用自注意力机制进行长距离上下文建模,并结合动态卷积实现实例特定的掩码预测,AuTR在多音源和开放集AVS基准上实现了最先进性能与优越的泛化能力。

ABSTRACT

The goal of the audio-visual segmentation (AVS) task is to segment the sounding objects in the video frames using audio cues. However, current fusion-based methods have the performance limitations due to the small receptive field of convolution and inadequate fusion of audio-visual features. To overcome these issues, we propose a novel extbf{Au}dio-aware query-enhanced extbf{TR}ansformer (AuTR) to tackle the task. Unlike existing methods, our approach introduces a multimodal transformer architecture that enables deep fusion and aggregation of audio-visual features. Furthermore, we devise an audio-aware query-enhanced transformer decoder that explicitly helps the model focus on the segmentation of the pinpointed sounding objects based on audio signals, while disregarding silent yet salient objects. Experimental results show that our method outperforms previous methods and demonstrates better generalization ability in multi-sound and open-set scenarios.

研究动机与目标

  • 为解决现有基于融合的方法在音视频分割中的局限性,特别是卷积核感受野较小以及音视频特征融合不足的问题。
  • 通过多模态Transformer架构实现音频与视觉特征的深层、长距离融合,以提升分割精度。
  • 明确引导模型聚焦于音频激活的物体,同时忽略静默但视觉显著的干扰物。
  • 在多音源和开放集等复杂场景中提升泛化能力,其中模型在推理时会遇到未见过的声音类别。

提出的方法

  • 采用多模态Transformer编码器,通过自注意力机制联合建模视觉与音频特征,实现超越卷积层限制的长距离上下文建模。
  • 在Transformer解码器中引入音频感知可学习查询,使其关注音视频特征,明确引导模型在分割过程中聚焦于发声物体。
  • 使用动态卷积进行分割掩码预测,其中卷积核参数由Transformer解码器基于查询特征生成,实现实例特定的掩码精细化。
  • 在训练过程中应用二分图匹配,将预测掩码与真实实例关联,提升监督信号质量与训练稳定性。
  • 采用预训练视觉编码器(ResNet50、PVT-v2)和VGGish进行音频特征提取,随后通过Transformer与解码器模块进行特征融合与优化。
  • 使用像素解码器聚合多尺度特征,并通过动态卷积模块生成高分辨率掩码预测。

实验结果

研究问题

  • RQ1与基于卷积的融合方法相比,采用音频感知查询的多模态Transformer是否能通过更优融合音频与视觉特征来提升分割精度?
  • RQ2在解码器中使用音频感知查询是否能增强模型仅定位发声物体的能力,同时抑制静默但显著的干扰物?
  • RQ3所提出的AuTR框架在多音源与开放集场景中的泛化能力如何,即模型在推理时遇到未见过的声音类别时的表现?
  • RQ4与固定卷积头相比,基于查询依赖核的动态卷积在多大程度上提升了掩码预测质量?
  • RQ5所提出的架构是否在封闭集与开放集AVS基准上均优于现有编码器-融合-解码器基线方法(如TPAVI)?

主要发现

  • 在S4基准上,AuTR使用PVT-v2主干网络实现了80.4%的平均交并比(mIoU),相比TPAVI基线提升4.74个百分点。
  • 在开放集AVS基准上,AuTR在未见类别上达到66.22%的mIoU(PVT-v2主干),尽管从已见类别到未见类别的性能有所下降,但仍比TPAVI高出10.36个百分点。
  • 在MS3子集上使用S4预训练权重进行微调时,AuTR在ResNet50主干下mIoU提升6.59个百分点,而TPAVI则下降3.56个百分点,表明AuTR具备更优的泛化能力。
  • 消融实验表明,若移除音频感知查询或动态卷积,性能分别下降至79.6%与79.5%的mIoU,验证了二者在框架中的关键作用。
  • 定性结果表明,AuTR能准确分割仅发声的物体,即使在复杂的多音源场景中也表现优异,而TPAVI常将静默但显著的物体错误包含在预测中。
  • 模型在PVT-v2主干下保持了0.891的高F1值,表明其在多样化测试场景中均具备出色的边界定位与精度表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。