Skip to main content
QUICK REVIEW

[论文解读] Ego-Exo: Transferring Visual Representations from Third-person to First-person Videos

Yanghao Li, Tushar Nagarajan|arXiv (Cornell University)|Apr 16, 2021
Human Pose and Action Recognition参考文献 72被引用 5
一句话总结

本文提出 Ego-Exo,一种利用大规模第三人称视频数据集对第一人称视频模型进行预训练的方法,通过在预训练过程中蒸馏潜在的第一人称特异性信号(如手-物体交互和第一人称视角特性)到视频主干网络中。该方法在 Charades-Ego(+3.26 mAP)和 EPIC-Kitchens-100 上达到最先进性能,优于需要成对第一人称数据或额外模态的方法。

ABSTRACT

We introduce an approach for pre-training egocentric video models using large-scale third-person video datasets. Learning from purely egocentric data is limited by low dataset scale and diversity, while using purely exocentric (third-person) data introduces a large domain mismatch. Our idea is to discover latent signals in third-person video that are predictive of key egocentric-specific properties. Incorporating these signals as knowledge distillation losses during pre-training results in models that benefit from both the scale and diversity of third-person video data, as well as representations that capture salient egocentric properties. Our experiments show that our Ego-Exo framework can be seamlessly integrated into standard video models; it outperforms all baselines when fine-tuned for egocentric activity recognition, achieving state-of-the-art results on Charades-Ego and EPIC-Kitchens-100.

研究动机与目标

  • 为解决第三人称与第一人称视频理解之间的域差距问题,现有在第三人称数据上进行预训练的方法因视角和注意力差异而表现不佳。
  • 利用大规模第三人称视频数据集(如 Kinetics)的规模与多样性,同时将第一人称特异性属性嵌入到学习到的特征中。
  • 开发一种预训练框架,提升第一人称视频理解性能,而无需使用成对的第一人称-第三人称视频或额外模态(如音频)。
  • 通过在预训练期间引入第一人称感知的蒸馏损失,使标准视频模型能够作为第一人称任务的即插即用强基线模型。

提出的方法

  • 该方法在第三人称视频的预训练过程中引入辅助知识蒸馏损失,利用从第三人称数据中推断出的未标注第一人称线索。
  • 关键蒸馏任务包括预测被操作的物体、定位时空上的手-物体交互区域,以及估计一般性第一人称视角程度。
  • 这些任务使用源自第三人称视频的自监督信号进行训练,无需任何第一人称标注或成对数据。
  • 该方法将这些损失与在 Kinetics 上的标准动作分类预训练相结合,使模型能够学习与第一人称视频特征一致的表征。
  • 该框架兼容标准视频架构(如 SlowFast、ResNet),可无缝应用于下游第一人称任务。
  • 蒸馏过程确保从第三人称数据中学到的特征被引导以捕捉第一人称特异性动态,如手部关注和第一人称运动模式。

实验结果

研究问题

  • RQ1能否从第三人称视频数据中推断出潜在的第一人称信号,以指导第一人称视频理解的预训练?
  • RQ2能否通过蒸馏第一人称特异性属性来提升第一人称动作识别性能,而无需使用成对的第一人称数据?
  • RQ3在第三人称数据上使用第一人称感知蒸馏损失进行预训练,是否优于在第一人称基准上使用标准 Kinetics 预训练?
  • RQ4能否通过统一的预训练框架在第一人称数据集上实现最先进性能,同时保持与标准视频模型的兼容性?

主要发现

  • 在 Charades-Ego 上,Ego-Exo 相较于标准 Kinetics 预训练提升了 +3.26 mAP,达到最先进性能。
  • 在 EPIC-Kitchens-100 上,Ego-Exo*-R101 在已见和未见测试集上均优于所有先前方法,包括使用音频和光流的方法。
  • Ego-Exo 在 EPIC-Kitchens S1 上达到 66.19% 的 top-1 准确率和 90.11% 的 top-5 准确率,优于使用音频和 RGB 流的 Epic-Fusion。
  • 即使基线方法(如 ActorObserverNet 和 SSDA)需要成对的第一人称-第三人称数据,Ego-Exo 仍表现更优。
  • 使用 SlowFast 主干的 Ego-Exo* 在 Charades-Ego 上达到 37.04% mAP,比最强基线高出 +3.26 mAP。
  • 该模型泛化能力良好,在 EPIC-Kitchens 的已见和未见类别上均保持一致的性能提升,表明对域偏移具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。