Skip to main content
QUICK REVIEW

[논문 리뷰] Class-agnostic Reconstruction of Dynamic Objects from Videos

Zhongzheng Ren, Xiaoming Zhao|arXiv (Cornell University)|2021. 12. 03.
Advanced Vision and Imaging인용 수 6
한 줄 요약

REDO는 RGBD 또는 校準된 비디오에서 부분적으로 가림되거나 카메라 시야가 제한된 상황에서도 동적 물체의 완전하고 시간적으로 일관된 형태를 클래스에 관계없이 4차원으로 재구성하는 프레임워크이다. 이는 픽셀에 정렬된 4차원 암시적 함수와 4차원 변환 모듈을 사용하여 시간에 걸친 시각적 신호를 통합하고 복잡한 운동을 모델링하며, 합성 및 실세계 벤치마크에서 최신 기술을 크게 앞서는 성능을 보인다.

ABSTRACT

We introduce REDO, a class-agnostic framework to REconstruct the Dynamic Objects from RGBD or calibrated videos. Compared to prior work, our problem setting is more realistic yet more challenging for three reasons: 1) due to occlusion or camera settings an object of interest may never be entirely visible, but we aim to reconstruct the complete shape; 2) we aim to handle different object dynamics including rigid motion, non-rigid motion, and articulation; 3) we aim to reconstruct different categories of objects with one unified framework. To address these challenges, we develop two novel modules. First, we introduce a canonical 4D implicit function which is pixel-aligned with aggregated temporal visual cues. Second, we develop a 4D transformation module which captures object dynamics to support temporal propagation and aggregation. We study the efficacy of REDO in extensive experiments on synthetic RGBD video datasets SAIL-VOS 3D and DeformingThings4D++, and on real-world video data 3DPW. We find REDO outperforms state-of-the-art dynamic reconstruction methods by a margin. In ablation studies we validate each developed component.

연구 동기 및 목표

  • 객체가 가림되거나 카메라 시야가 제한된 상황에서 비디오에서 부분적으로만 가시한 동적 물체의 완전한 4차원 형태를 재구성하는 문제를 해결하기 위해.
  • 강체 운동, 비강성 변형, 관절 운동과 같은 다양한 물체 운동을 카테고리별 사전 지식 없이 통합적으로 처리할 수 있는 프레임워크를 개발하기 위해.
  • 미리 보지 않은 카테고리의 객체에 대해 피팅 조정 없이도 일반화 가능한 클래스에 관계없는 재구성을 가능하게 하기 위해.
  • 기준 4차원 공간에서 시간에 걸친 시각적 신호를 통합함으로써 시간적 일관성과 기하학적 정확성을 확보하기 위해.

제안 방법

  • 시각 입력과 픽셀에 정렬된 기준 4차원 암시적 함수를 도입하여 다수의 프레임에서 시간적 신호를 통합하고 완전한 물체 형태를 재구성한다.
  • 물체 운동을 모델링하는 4차원 변환 모듈을 활용하여 시간 단계 간의 특징 전파 및 통합을 가능하게 한다.
  • 3D 예측가 2D 시각 관측과 정확히 일치하도록 픽셀에 정렬된 특징 표현 (x_p, z_p)을 사용함으로써 부분적 가림에 대한 강건성을 향상시킨다.
  • 변환기 기반 메커니즘을 사용해 다수의 프레임에서 특징을 융합하는 미분 가능한 시간 평균기 (f_agg)를 적용하여 형태 재구성 성능을 향상시킨다.
  • 학습 중 네트워크를 감독하기 위해 형태 재구성 손실 (L_shape) 과 시간 일관성 손실 (L_temp) 을 활용한다.
  • 다양한 구성 요소를 모두 미분 가능하게 학습함으로써 엔드 투 엔드로 훈련함으로써, 피팅 조정 없이도 새로운 객체 카테고리에 대해 제로샷 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1일관되지 않은 비디오에서 부분적으로 가시한 다양한 동적 물체의 완전한 4차원 형태를 단일 통합 프레임워크로 재구성할 수 있는가?
  • RQ22차원 시각 입력과 픽셀에 정렬된 4차원 암시적 표현은 기하학적 정렬과 재구성 정확도를 향상시키는 데 어떻게 기여하는가?
  • RQ3클래스에 관계없는 모델은 피팅 조정 없이 얼마나 잘 새로운 객체 카테고리에 일반화되는가?
  • RQ44차원 변환 모듈은 강체 운동, 비강성 변형, 관절 운동과 같은 복잡한 운동을 얼마나 효과적으로 모델링하는가?
  • RQ5픽셀 정렬과 시간 통합은 가림과 같은 도전적인 조건에서 재구성 품질에 얼마나 기여하는가?

주요 결과

  • SAIL-VOS 3D에서 REDO는 38.5 mIoU, 0.479 mCham., 1.07 mACD를 기록하며, OFlow 대비 +5.9 mIoU, -0.085 mCham., -0.22 mACD의 성능 향상을 보였다.
  • DeformingThings4D++에서 REDO는 OFlow 대비 +2.2 mIoU, -0.063 mCham., -0.047 mACD의 성능 향상을 기록했다.
  • 실세계 3DPW 데이터셋에서 REDO는 OFlow 대비 +10.1 mIoU, -0.124 mCham., -0.061 mACD의 성능 향상을 기록하며 강력한 일반화 능력을 입증했다.
  • 새로운 클래스(개, 고릴라, 펌파)에 대한 제로샷 평가에서 REDO는 치명적인 실패 없이 강력한 성능을 유지하며 일반화 능력을 확인했다.
  • 절단 실험 결과, 픽셀 정렬을 제거하면 mIoU가 7.8점 감소하고, 시간 손실을 제거하면 mACD가 1.65 증가함을 확인하여 두 구성 요소의 중요성을 입증했다.
  • 정성적 결과에서는 REDO가 가림된 부분(예: 뒷바퀴, 다리)을 성공적으로 재구성하고 대규모 운동을 포착하지만, 손의 움직임과 같은 세부 사항은 정확도가 다소 떨어지는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.