[论文解读] Leveraging Foundation models for Unsupervised Audio-Visual Segmentation
本文提出一种无需训练、无监督的音视频分割方法,利用预训练的基础模型,消除对昂贵像素级音视频掩码标注的需求。通过结合音频识别与开放世界检测的跨模态语义过滤(CMSF),该方法在重叠物体场景下表现强劲——尽管未进行微调或显式音视频融合,其在复杂场景中的性能仍优于监督基线方法。
Audio-Visual Segmentation (AVS) aims to precisely outline audible objects in a visual scene at the pixel level. Existing AVS methods require fine-grained annotations of audio-mask pairs in supervised learning fashion. This limits their scalability since it is time consuming and tedious to acquire such cross-modality pixel level labels. To overcome this obstacle, in this work we introduce unsupervised audio-visual segmentation with no need for task-specific data annotations and model training. For tackling this newly proposed problem, we formulate a novel Cross-Modality Semantic Filtering (CMSF) approach to accurately associate the underlying audio-mask pairs by leveraging the off-the-shelf multi-modal foundation models (e.g., detection [1], open-world segmentation [2] and multi-modal alignment [3]). Guiding the proposal generation by either audio or visual cues, we design two training-free variants: AT-GDINO-SAM and OWOD-BIND. Extensive experiments on the AVS-Bench dataset show that our unsupervised approach can perform well in comparison to prior art supervised counterparts across complex scenarios with multiple auditory objects. Particularly, in situations where existing supervised AVS methods struggle with overlapping foreground objects, our models still excel in accurately segmenting overlapped auditory objects. Our code will be publicly released.
研究动机与目标
- 解决监督式音视频分割的可扩展性局限,后者需要昂贵且细粒度的像素级音视频掩码标注。
- 实现在无需任何任务特定微调或标注数据情况下的无监督音视频分割。
- 利用预训练的基础模型(如音频识别、目标检测和多模态对齐模型)以零样本、无需训练的方式生成精确的分割掩码。
- 提升在复杂场景中重叠听觉对象的分割性能,此类场景中监督方法常出现失败。
- 证明开放世界检测与多模态基础模型可有效结合,实现无需显式音视频融合的鲁棒、泛化性强的音视频分割。
提出的方法
- 提出跨模态语义过滤(CMSF),一种基础模型级联结构,交替利用音视频模态生成并过滤分割提议。
- 实现 AT-GDINO-SAM:使用音频识别模型(AST)生成音频标签,再通过 DINO 和 SAM 利用这些标签引导目标检测与分割。
- 实现 OWOD-BIND:使用开放世界目标检测器(OWOD)生成边界框提议,再通过 ImageBIND 的音频嵌入与之计算余弦相似度进行过滤。
- 利用预训练模型(如 AST 用于音频识别,DINO 用于目标检测,ImageBIND 用于跨模态对齐)且不进行任何微调。
- 利用 SAM 的图像编码器与提示编码器实现零样本分割,由基础模型提供的音视频线索引导。
- 应用一种过滤机制,将视觉提议与音频嵌入投影至共享潜在空间,以确保语义一致性。
实验结果
研究问题
- RQ1能否利用基础模型在无需微调或标注数据的情况下实现无监督音视频分割?
- RQ2基于现成模型的无需训练方法在性能上与监督式 AVS 方法相比如何,特别是在存在重叠物体的复杂场景中?
- RQ3开放世界检测与多模态对齐模型是否能提升零样本、开放集设置下的分割精度?
- RQ4当依赖 SAM 和 ImageBIND 等基础模型时,无监督 AVS 的主要失败模式是什么?
- RQ5在定位精度与重叠处理方面,音视频引导的提议生成方法在多大程度上能优于端到端的监督方法?
主要发现
- OWOD-BIND 在 AVSBench 的 MS3 设置下实现 M_IOU 0.58 和 F_score 0.67,优于无微调的监督方法 AV-SAM(M_IOU: 0.40, F_score: 0.56)。
- 在 S4 设置下,OWOD-BIND 相较于 SAM-BIND 在 M_IOU 和 F_score 上均提升 0.16,证明了开放世界检测与音视频过滤的优势。
- 该方法成功分割了重叠的听觉对象(如钢琴与人),无需显式音视频融合,生成连续且精确的掩码。
- 尽管平均性能低于 AVSBench(M_IOU: 0.78),OWOD-BIND 生成了更细致的细节,并更好地处理了非立方体物体(如人)。
- 失败案例包括 SAM 的过分割(如将钢琴琴键分开)、定位不精确(如未能仅隔离钢琴琴键),以及因缺乏时序建模而无法区分说话与非说话人物。
- 该方法表明,基础模型可通过级联方式有效结合,实现强大的零样本 AVS 性能,尤其在开放集与复杂场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。