Skip to main content
QUICK REVIEW

[논문 리뷰] EPIC Fields: Marrying 3D Geometry and Video Understanding

Vadim Tschernezki, Ahmad Darkhalil|arXiv (Cornell University)|2023. 06. 14.
Advanced Neural Network Applications인용 수 6
한 줄 요약

EPIC Fields는 단일 시각적 영상에서 추가 스캔이나 하드웨어 없이 전체 프레임 레이트의 카메라 자세 궤적을 복원함으로써, 3D 확장된 EPIC-KITCHENS의 에고세트릭 비디오 데이터셋을 제공한다. 이는 종단 간 3D 기하학 및 비디오 이해를 가능하게 하며, 신선한 시각 합성, 동적 객체 분할, 준지도 기반 비디오 객체 분할을 지원한다. 96%의 비디오 재구성 성공률를 기록했으며, 동적 콘텐츠의 3D 비디오 이해 과제를 부각시키는 강력한 베이스라인을 제공한다.

ABSTRACT

Neural rendering is fuelling a unification of learning, 3D geometry and video understanding that has been waiting for more than two decades. Progress, however, is still hampered by a lack of suitable datasets and benchmarks. To address this gap, we introduce EPIC Fields, an augmentation of EPIC-KITCHENS with 3D camera information. Like other datasets for neural rendering, EPIC Fields removes the complex and expensive step of reconstructing cameras using photogrammetry, and allows researchers to focus on modelling problems. We illustrate the challenge of photogrammetry in egocentric videos of dynamic actions and propose innovations to address them. Compared to other neural rendering datasets, EPIC Fields is better tailored to video understanding because it is paired with labelled action segments and the recent VISOR segment annotations. To further motivate the community, we also evaluate two benchmark tasks in neural rendering and segmenting dynamic objects, with strong baselines that showcase what is not possible today. We also highlight the advantage of geometry in semi-supervised video object segmentations on the VISOR annotations. EPIC Fields reconstructs 96% of videos in EPICKITCHENS, registering 19M frames in 99 hours recorded in 45 kitchens.

연구 동기 및 목표

  • 3D 기하학과 비디오 이해를 동시에 지원하는 대규모 3D 레이블링이 된 에고세트릭 비디오 데이터셋의 부족을 해결하기 위해.
  • 기존의 구조-운동 방법이 고속도 및 장시간으로 인해 실패하는 상황에서, 동적 에고세트릭 비디오의 강력한 3D 재구성을 가능하게 하기 위해.
  • 3D 카메라 자세를 고밀도 동작 및 객체 레이블과 통합하여 신경 렌더링과 의미적 비디오 이해의 통합 벤치마크를 제공하기 위해.
  • 특히 동적 장면에서 기하학적 사전 지식이 준지도 기반 비디오 객체 분할에 어떤 가치를 기여하는지 입증하기 위해.
  • 포토그램메트리 또는 사전 스캔이 필요 없도록 연구자들이 3D 비디오 이해에 접근하는 데 있어 장벽을 낮추기 위해.

제안 방법

  • 에고세트릭 비디오에서 프레임을 서브샘플링하는 사전 처리 파이프라인을 제안하여, 구조-운동(SfM) 재구성의 신뢰성과 속도를 향상시킨다.
  • 추가 센서나 스캔 없이도 단일 시각적 영상에서 전체 프레임 레이트의 3D 카메라 자세 궤적을 직접 복원한다.
  • VISOR 데이터셋의 고밀도 인스턴스 수준 레이블을 활용하여 의미 인식 기반 3D 비디오 이해 벤치마크를 가능하게 한다.
  • 세 가지 새로운 벤치마크 과제를 도입한다: 동적 신선한 시각 합성(NVS), 비지도 동적 객체 분할(UDOS), 준지도 기반 비디오 객체 분할(VOS).
  • 재구성된 3D 기하학과 의미 레이블을 기반으로 NeRF-W, T-NeRF+, NeuralDiff, MG, STM, XMEM을 사용해 강력한 베이스라인을 훈련하고 평가한다.
  • 동일한 재구성 파이프라인을 Ego4D 비디오에 적용하여, EPIC-KITCHENS 외 다른 에고세트릭 데이터셋으로의 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1추가 하드웨어나 스캔 없이도 고도로 동적인 장시간 에고세트릭 비디오에서 신뢰성 있는 3D 카메라 자세 재구성이 가능할 수 있는가?
  • RQ23D 기하학적 지시가 동적 비디오 객체 분할 과제에서 성능 향상에 어느 정도 기여하는가?
  • RQ33D 기하학과 의미적 비디오 이해의 통합이 복잡한 에고세트릭 장면에서 신선한 시각 합성에 어떤 영향을 미치는가?
  • RQ4현행 신경 렌더링 모델이 실제 동적 에고세트릭 비디오 데이터에 적용되었을 때의 한계는 무엇인가?
  • RQ5제안된 파이프라인이 Ego4D와 같은 다른 에고세트릭 비디오 데이터셋으로 일반화 가능한가?

주요 결과

  • EPIC Fields는 EPIC-KITCHENS의 96%의 비디오를 성공적으로 재구성했으며, 45개 주방에서 총 99시간 동안 1900만 프레임을 기록했다.
  • 제안된 서브샘플링 전략은 기존의 표준 SfM 파이프라인 대비 에고세트릭 비디오에서 재구성의 신뢰성과 속도를 크게 향상시켰다.
  • 준지도 기반 비디오 객체 분할은 3D 기하학적 사전 지식으로부터 유의미한 이점을 얻었으며, 고정된 3D 기반 베이스라인은 정적 객체에서는 2D 기반 베이스라인을 초월했지만, 동적 객체에서는 둘 다 실패했다.
  • 신선한 시각 합성 및 동적 객체 분할을 위한 베이스라인은 정적 또는 저속도 장면에서는 뛰어난 성능을 보였지만, 고속도 동적 요소에서는 어려움을 겪었으며, 이는 현재 기법들 사이의 격차를 보여준다.
  • 파이프라인이 Ego4D 비디오로 일반화되었으며, 사다리 등반, 무릎 꿇기, 이동 중 이동 등 도전적인 상황에서도 카메라 자세를 성공적으로 재구성했다.
  • 이 데이터셋은 http://epic-kitchens.github.io/epic-fields 에서 공개되어, 향후 실제 세계의 에고세트릭 데이터를 활용한 3D 비디오 이해 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.