[论文解读] Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment
本文提出了一种新颖的音视频损失函数——相对范数对齐(RNA),通过动态平衡视觉与音频特征的相对大小,提升跨域第一人称动作识别性能。通过对模态特异性特征的相对范数进行对齐,RNA 在域泛化与无监督域自适应设置下均增强了泛化能力,在 EPIC-Kitchens 数据集上以极简架构实现最先进性能。
First person action recognition is an increasingly researched topic because of the growing popularity of wearable cameras. This is bringing to light cross-domain issues that are yet to be addressed in this context. Indeed, the information extracted from learned representations suffers from an intrinsic environmental bias. This strongly affects the ability to generalize to unseen scenarios, limiting the application of current methods in real settings where trimmed labeled data are not available during training. In this work, we propose to leverage over the intrinsic complementary nature of audio-visual signals to learn a representation that works well on data seen during training, while being able to generalize across different domains. To this end, we introduce an audio-visual loss that aligns the contributions from the two modalities by acting on the magnitude of their feature norm representations. This new loss, plugged into a minimal multi-modal action recognition architecture, leads to strong results in cross-domain first person action recognition, as demonstrated by extensive experiments on the popular EPIC-Kitchens dataset.
研究动机与目标
- 解决由学习表征中环境偏差引起的首人称动作识别中的域偏移问题。
- 在训练期间无需访问目标数据的情况下,提升对未见域的泛化能力。
- 利用音频与视觉模态的互补性,增强在多样化环境中的鲁棒性。
- 开发一种轻量化、高效的损失函数,提升模态协作能力,而无需复杂架构。
- 为自 egocentric 视频动作识别中的单源与多源域泛化建立新基准。
提出的方法
- 提出一种新型跨模态损失——相对范数对齐(RNA),其基于视觉与音频特征范数的相对大小进行操作。
- RNA 损失通过在训练过程中最小化模态间范数分布的差异,动态调整各模态的相对贡献。
- 该方法可灵活集成至简单的音视频双流网络中,采用晚期或中级特征融合。
- 损失函数旨在保持类内紧凑性与结构判别力,同时减少模态不平衡。
- 在 EPIC-Kitchens 数据集上,于域泛化(DG)与无监督域自适应(UDA)设置下验证该方法。
- 消融实验对比了 RNA 与硬范数对齐基线及标准自监督同步任务。
实验结果
研究问题
- RQ1在第一人称动作识别中,音频与视觉模态能否被有效平衡以减少域偏移?
- RQ2动态对齐音频与视觉流的相对特征范数是否能提升在未见环境中的泛化能力?
- RQ3在跨域设置下,所提出的 RNA 损失与对抗性与自监督对齐方法相比表现如何?
- RQ4像 RNA 这类轻量化、模态特异性损失能否在域泛化任务中超越更复杂架构?
- RQ5RNA 损失是否如类激活图所示,使网络产生更局部化且可解释的注意力?
主要发现
- 在多源域泛化设置下,RNA 实现 51.06% 的 top-1 准确率,较基线提升 6.39 个百分点。
- 在无监督域自适应设置下,RNA 达到 47.71% 的准确率,较基线提升 1.95%。
- 与对抗性对齐方法相比,性能提升 4%,且在使用更简单架构的情况下,性能与更复杂的 MM-SADA 方法相当。
- 消融实验表明,RNA 持续优于硬范数对齐(HNA)变体,证实了相对范数调整相比固定范数调整的优势。
- 定性分析显示,RNA 提升了特征选择性,前 300 个特征的范数贡献维持或增加,从而产生更清晰的类激活图。
- RNA 与对抗性对齐结合后带来轻微性能提升,表明二者在分布保持与模态平衡方面具有互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。