Skip to main content
QUICK REVIEW

[论文解读] Learning State-Aware Visual Representations from Audible Interactions

Himangi Mittal, Pedro Morgado|arXiv (Cornell University)|Sep 27, 2022
Human Pose and Action Recognition被引用 14
一句话总结

本文提出 RepLAI,一种自监督方法,利用音频识别交互时刻,并从未经剪辑的视角视频中学习状态感知的视觉表征。通过结合基于音频的时刻检测与一种新颖的音视频状态变化目标,RepLAI 在动作识别、长期预测和物体状态变化分类任务上表现更优,在 Ego4D 上超越了监督基线方法,并在长尾分布上展现出强大的泛化能力。

ABSTRACT

We propose a self-supervised algorithm to learn representations from egocentric video data. Recently, significant efforts have been made to capture humans interacting with their own environments as they go about their daily activities. In result, several large egocentric datasets of interaction-rich multi-modal data have emerged. However, learning representations from videos can be challenging. First, given the uncurated nature of long-form continuous videos, learning effective representations require focusing on moments in time when interactions take place. Second, visual representations of daily activities should be sensitive to changes in the state of the environment. However, current successful multi-modal learning frameworks encourage representation invariance over time. To address these challenges, we leverage audio signals to identify moments of likely interactions which are conducive to better learning. We also propose a novel self-supervised objective that learns from audible state changes caused by interactions. We validate these contributions extensively on two large-scale egocentric datasets, EPIC-Kitchens-100 and the recently released Ego4D, and show improvements on several downstream tasks, including action recognition, long-term action anticipation, and object state change classification.

研究动机与目标

  • 解决从未经剪辑、交互丰富的视角视频中学习有效视觉表征的挑战,其中交互事件稀疏且未经整理。
  • 克服现有自监督方法的局限性,这些方法通过增强对环境状态变化的敏感性来学习不变表征。
  • 不仅利用音频信号进行时刻检测,还将其作为监督信号,以学习对视觉状态转换敏感的表征。
  • 提升在视角视频设置下动作识别、长期动作预测和物体状态变化分类等下游任务的性能。

提出的方法

  • 使用基于手工谱图的检测器识别未经剪辑的视角视频中的交互时刻(MoI),并将训练聚焦于这些显著片段。
  • 提出一种新颖的音视频自监督目标 AStC,促使音频表征能够反映随时间推移的视觉状态变化。
  • 将 AStC 目标与标准的音视频对比损失(AVC)结合,联合学习既对齐音视频又具备状态感知能力的表征。
  • 采用双流对比学习框架,通过实例判别对视觉和音频特征进行投影与对比,结合 MoI 引导的采样策略。
  • 在大规模视角数据集(EPIC-Kitchens-100 和 Ego4D)上使用 MoI 过滤的片段进行预训练,以提升表征质量。
  • 通过 t-SNE 可视化证明,与基线方法相比,RepLAI 学习到的表征更具区分性且具备更强的状态感知能力。

实验结果

研究问题

  • RQ1音频信号能否有效用于检测未经剪辑的视角视频中的交互时刻,从而提升自监督表征学习?
  • RQ2一种建模音视频状态变化的自监督目标,是否能比标准对比目标生成更具信息量的视觉表征?
  • RQ3所提出的方法在视角视频基准测试中对长尾分布和未见参与者是否具有更好的泛化能力?
  • RQ4所提出方法的各个组件(MoI 检测与 AStC 目标)对整体性能的贡献如何?

主要发现

  • RepLAI 在 EPIC-Kitchens-100 和 Ego4D 数据集上的动作识别、长期动作预测和物体状态变化分类任务中均达到最先进性能。
  • 消融研究显示,MoI 检测与 AStC 目标均至关重要且具有互补性,各自对性能提升均有显著贡献。
  • RepLAI 在未见参与者上的零样本评估中表现优于基线方法,表明其表征具备鲁棒性与可迁移性。
  • 在 EPIC-Kitchens-100 的长尾动词和名词类别上,RepLAI 超过所有基线方法,展现出对类别不平衡的更强鲁棒性。
  • t-SNE 可视化证实,与 AVID 或其他基线方法相比,RepLAI 学习到的表征更具区分性,聚类分离度更高。
  • 在 Ego4D 上,RepLAI 的表现与全监督方法相当,表明在更大、更多样化的数据下,自监督学习可接近监督学习性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。