[论文解读] A Unified Audio-Visual Learning Framework for Localization, Separation, and Recognition
本文提出 OneAVM,一种统一的音视频学习框架,通过共享编码器和任务特定解码器,联合执行声音源定位、分离与识别。通过整合音视频对应性、混合音频分离以及一种新颖的混合视觉对齐目标,OneAVM 在无需任务特定微调的情况下,在所有三项任务上均达到最先进性能,展示了在 MUSIC、VGG-Instruments、VGG-Music 和 VGGSound 数据集上的强大跨任务迁移能力。
The ability to accurately recognize, localize and separate sound sources is fundamental to any audio-visual perception task. Historically, these abilities were tackled separately, with several methods developed independently for each task. However, given the interconnected nature of source localization, separation, and recognition, independent models are likely to yield suboptimal performance as they fail to capture the interdependence between these tasks. To address this problem, we propose a unified audio-visual learning framework (dubbed OneAVM) that integrates audio and visual cues for joint localization, separation, and recognition. OneAVM comprises a shared audio-visual encoder and task-specific decoders trained with three objectives. The first objective aligns audio and visual representations through a localized audio-visual correspondence loss. The second tackles visual source separation using a traditional mix-and-separate framework. Finally, the third objective reinforces visual feature separation and localization by mixing images in pixel space and aligning their representations with those of all corresponding sound sources. Extensive experiments on MUSIC, VGG-Instruments, VGG-Music, and VGGSound datasets demonstrate the effectiveness of OneAVM for all three tasks, audio-visual source localization, separation, and nearest neighbor recognition, and empirically demonstrate a strong positive transfer between them.
研究动机与目标
- 为解决任务特定模型在音视频感知中的局限性,将定位、分离与识别统一到单一框架中。
- 通过联合优化音视频对应性、源分离和视觉特征解耦,利用跨任务迁移。
- 通过引入一种新颖的混合视觉对齐目标,将混合图像与各个声源对齐,提升声音源定位与分离的性能。
- 证明多任务联合优化可提升泛化能力与鲁棒性,尤其在存在多个声源的复杂场景中。
- 提供一个单一统一的模型,在无需为每个下游任务微调的情况下,超越任务特定基线模型。
提出的方法
- OneAVM 使用共享的双流音视频编码器,从视频和音频输入中提取联合表征。
- 该框架采用局部音视频对应损失,在帧级别对齐音频与视觉特征。
- 在音频流上应用“混合与分离”目标,以学习源分离的判别性表征。
- 提出一种新颖的混合视觉对齐(MVA)目标,该目标在像素空间混合图像,并将其表征与所有对应声源对齐。
- 任务特定解码器通过三个目标进行训练:音视频对应性、音频分离,以及通过 MVA 实现的视觉特征解耦。
- 模型通过多任务学习端到端训练,实现在定位、分离与识别任务间的共享表征学习。
实验结果
研究问题
- RQ1一个统一的音视频模型能否在不降低任一任务性能的前提下,联合优化声音源定位、分离与识别?
- RQ2混合视觉对齐的整合如何提升视觉特征解耦与定位准确率?
- RQ3联合优化对跨任务迁移的影响如何,特别是定位与分离任务之间的迁移?
- RQ4与标准监督相比,所提出的 MVA 目标在视觉输入混合时是否能增强表征学习?
- RQ5在多源条件下,统一框架相较于任务特定模型在性能与泛化能力方面表现如何?
主要发现
- OneAVM 在视觉声音源定位任务上达到最先进性能,在 VGGSound-All 数据集上对三个或以上声源的定位精度达到 39.68%,优于 CCoL 与 EZ-VSL。
- 当联合训练对应性与定位目标时,与仅训练分离的基线相比,OneAVM 在分离性能上提升了 1.53 SDR 与 1.6 SAR。
- 源分离任务的最优解码器深度为 8,更深的网络因过拟合导致性能下降。
- 在混合视觉对齐(MVA)目标中,混合比例为 0.5 时,所有指标下的定位性能最佳。
- 与基线相比,OneAVM 在声源数量增加时表现出更慢的性能衰减,表明其在复杂场景中具有更强鲁棒性。
- 尽管在 MUSIC 数据集上的 SAR 略低于 MP-Net,但 OneAVM 在定位与识别任务上表现更优,充分体现了多任务协同的显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。