Skip to main content
QUICK REVIEW

[论文解读] EPIC Fields: Marrying 3D Geometry and Video Understanding

Vadim Tschernezki, Ahmad Darkhalil|arXiv (Cornell University)|Jun 14, 2023
Advanced Neural Network Applications被引用 6
一句话总结

EPIC Fields 在 EPIC-KITCHENS 的第一人称视频数据集基础上,引入了 3D 扩展版本,通过仅使用单目第一人称视频、无需额外扫描或硬件,即可重建全帧率的相机位姿轨迹,从而实现端到端的 3D 几何与视频理解。该数据集支持新视角合成、动态物体分割以及弱监督视频实例分割,实现了 96% 的视频重建成功率,并提供了强有力的基线模型,凸显了在 3D 视频理解中动态内容带来的挑战。

ABSTRACT

Neural rendering is fuelling a unification of learning, 3D geometry and video understanding that has been waiting for more than two decades. Progress, however, is still hampered by a lack of suitable datasets and benchmarks. To address this gap, we introduce EPIC Fields, an augmentation of EPIC-KITCHENS with 3D camera information. Like other datasets for neural rendering, EPIC Fields removes the complex and expensive step of reconstructing cameras using photogrammetry, and allows researchers to focus on modelling problems. We illustrate the challenge of photogrammetry in egocentric videos of dynamic actions and propose innovations to address them. Compared to other neural rendering datasets, EPIC Fields is better tailored to video understanding because it is paired with labelled action segments and the recent VISOR segment annotations. To further motivate the community, we also evaluate two benchmark tasks in neural rendering and segmenting dynamic objects, with strong baselines that showcase what is not possible today. We also highlight the advantage of geometry in semi-supervised video object segmentations on the VISOR annotations. EPIC Fields reconstructs 96% of videos in EPICKITCHENS, registering 19M frames in 99 hours recorded in 45 kitchens.

研究动机与目标

  • 为解决缺乏大规模、带 3D 标注的第一人称视频数据集的问题,这些数据集需同时支持 3D 几何与视频理解。
  • 在传统运动结构法(SfM)因高运动与长时间序列而失效的情况下,实现对动态第一人称视频的鲁棒 3D 重建。
  • 通过将 3D 相机位姿与密集的动作及物体标注相结合,为神经渲染与语义视频理解提供统一的基准。
  • 展示几何先验在弱监督视频实例分割中的价值,尤其是在动态场景中的表现。
  • 通过消除对摄影测量或预扫描的需求,降低研究人员在 3D 视频理解领域的入门门槛。

提出的方法

  • 提出一种预处理流程,通过从第一人称视频中子采样帧,以提升运动结构法(SfM)重建的可靠性与速度。
  • 直接从单目第一人称视频序列中重建全帧率的 3D 相机位姿轨迹,无需额外传感器或扫描。
  • 利用 VISOR 数据集的密集实例级标注,实现语义感知的 3D 视频理解基准。
  • 引入三项新基准任务:动态新视角合成(NVS)、无监督动态物体分割(UDOS)与弱监督视频实例分割(VOS)。
  • 在重建的 3D 几何结构与语义标签上,使用 NeRF-W、T-NeRF+、NeuralDiff、MG、STM 与 XMEM 训练并评估强基线模型。
  • 将相同的重建流程应用于 Ego4D 视频,证明其在 EPIC-KITCHENS 之外的其他第一人称数据集上的泛化能力。

实验结果

研究问题

  • RQ1在无额外硬件或扫描的情况下,是否能可靠地在高度动态、长时间的第一人称视频中实现 3D 相机位姿重建?
  • RQ23D 几何监督在动态视频实例分割任务中的性能提升程度如何?
  • RQ33D 几何与语义视频理解的结合,如何增强复杂第一人称场景下的新视角合成性能?
  • RQ4当前神经渲染模型在应用于真实世界、动态的第一人称视频数据时存在哪些局限性?
  • RQ5所提出的流程是否能泛化至其他第一人称视频数据集(如 Ego4D)?

主要发现

  • EPIC Fields 在 EPIC-KITCHENS 中成功重建了 96% 的视频,共注册了 1900 万帧,覆盖 99 小时的录制内容,分布在 45 间厨房中。
  • 所提出的子采样策略相比标准 SfM 流程,在第一人称视频上显著提升了重建的可靠性和速度。
  • 弱监督视频实例分割从 3D 几何先验中获益,固定 3D 基线在静态物体上优于 2D 基线,但两者在动态物体上均表现失败。
  • 新视角合成与动态物体分割的基线模型在静态或低运动场景中表现良好,但在高动态场景中表现吃力,表明当前方法仍存在明显差距。
  • 该流程可泛化至 Ego4D 视频,在攀爬梯子、下跪、移动中导航等挑战性场景中成功重建了相机位姿。
  • 该数据集已公开获取:http://epic-kitchens.github.io/epic-fields,为未来基于真实世界第一人称数据的 3D 视频理解研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。