Skip to main content
QUICK REVIEW

[논문 리뷰] Dense Depth Estimation of a Complex Dynamic Scene without Explicit 3D Motion Estimation

Suryansh Kumar, Ram Srivatsav Ghorakavi|arXiv (Cornell University)|2019. 02. 11.
Advanced Vision and Imaging참고 문헌 31인용 수 12
한 줄 요약

이 논문은 3D 운동 추정을 직접 수행하지 않고, 희박한 깊이 사전 지식과 광학 흐름을 유일한 입력으로 사용하여 복잡한 동적 환경에서의 고밀도 깊이 추정을 위한 새로운 방법을 제안한다. 장면을 국소적으로 평면적인 구조로 모델링하고, 가능한 한 강성 유지(ARAP) 제약 조건을 적용함으로써 명시적인 3D 운동 추정을 회피한다. 이 방법은 점진적이고 효율적으로 정확한 깊이 맵을 도출하며, SE(3) 최적화나 개별 객체의 운동 추정에 의존하지 않고도 벤치마크 데이터셋에서 뛰어난 성능을 보인다.

ABSTRACT

Recent geometric methods need reliable estimates of 3D motion parameters to procure accurate dense depth map of a complex dynamic scene from monocular images \cite{kumar2017monocular, ranftl2016dense}. Generally, to estimate extbf{precise} measurements of relative 3D motion parameters and to validate its accuracy using image data is a challenging task. In this work, we propose an alternative approach that circumvents the 3D motion estimation requirement to obtain a dense depth map of a dynamic scene. Given per-pixel optical flow correspondences between two consecutive frames and, the sparse depth prior for the reference frame, we show that, we can effectively recover the dense depth map for the successive frames without solving for 3D motion parameters. Our method assumes a piece-wise planar model of a dynamic scene, which undergoes rigid transformation locally, and as-rigid-as-possible transformation globally between two successive frames. Under our assumption, we can avoid the explicit estimation of 3D rotation and translation to estimate scene depth. In essence, our formulation provides an unconventional way to think and recover the dense depth map of a complex dynamic scene which is incremental and motion free in nature. Our proposed method does not make object level or any other high-level prior assumption about the dynamic scene, as a result, it is applicable to a wide range of scenarios. Experimental results on the benchmarks dataset show the competence of our approach for multiple frames.

연구 동기 및 목표

  • 3D 운동 추정이 오류를 일으키기 쉬우며 계산 비용이 높은 복잡한 동적 환경에서 정확한 고밀도 깊이 추정의 과제를 해결한다.
  • 깊이 복구를 위해 명시적인 3D 운동 매개변수 추정에 의존하는 기존 기하학적 방법의 한계를 극복한다.
  • 희박한 깊이 사전 지식과 광학 흐름을 활용하여, SE(3) 운동 매개변수를 풀지 않고도 점진적으로 고밀도 깊이 맵을 추론하는 방법을 개발한다.
  • 국소적 강성과 전반적인 가능한 한 강성 유지 변형을 가정함으로써 실제 환경의 동적 특성을 반영한 강건한 깊이 추정을 가능하게 한다.
  • 운동 기반의 구조-운동에서의 재구성 파이프라인에 대한 확장 가능하고 효율적인 대안을 제공한다.

제안 방법

  • 초광역 영역 기반 K-최근접 이웃 근사법을 사용하여 국소 평면 표면의 집합으로 동적 장면을 모델링한다.
  • 이웃 3D 점들 사이의 거리 일관성을 강제하는 가능한 한 강성 유지(ARAP) 제약 조건을 적용하여, 강성과 유사한 변형에서의 왜곡을 최소화한다.
  • 기준 프레임의 알려진 희박한 깊이를 사용하여 각 평면의 법선을 초기화하고, ARAP 최적화를 통해 다음 프레임로 깊이를 전파한다.
  • ARAP 목적 함수를 설정하여 강성 운동에서의 편차를 최소화하면서도 이웃 점들 간의 3D 유클리드 거리를 유지한다.
  • 변형 범위의 사전 지식($d_{i au}$)을 기반으로 제한된 등거리성 제약 조건을 도입하여 수렴 속도를 가속화하고 정확도를 향상시킨다.
  • TRW-S 최적화를 적용하여 평면 경계를 넘어서 깊이의 연속성을 확보함으로써 최종 깊이 맵의 블록 아티팩트를 감소시킨다.

실험 결과

연구 질문

  • RQ1명시적인 3D 운동 매개변수 추정 없이도 동적 환경에서 고밀도 깊이 추정을 달성할 수 있는가?
  • RQ2SE(3) 최적화 없이도 가능한 한 강성 유지(ARAP) 제약 조건이 실제 동적 장면의 변형을 얼마나 효과적으로 모델링할 수 있는가?
  • RQ3장면의 변형 범위에 대한 사전 지식이 깊이 추정의 수렴과 정확도에 얼마나 기여하는가?
  • RQ4복잡한 동적 조건 하에서 표준 벤치마크에서 제안된 방법은 운동 기반 접근법에 비해 어떻게 성능을 발휘하는가?
  • RQ5깊이 연속성 제약 조건이 있는 조각별 평면 모델은 개별 객체의 운동 추정 없이도 시각적·정량적으로 정확한 깊이 맵을 생성할 수 있는가?

주요 결과

  • 제안된 방법은 명시적인 3D 운동 매개변수 추정 없이도 벤치마크 데이터셋에서 경쟁적인 깊이 추정 정확도를 달성한다.
  • 길이 일관성 제약 조건을 가진 ARAP 설정은 비강성 장면에서도 안정적이고 정확한 프레임 간 깊이 전파를 가능하게 한다.
  • 제한된 등거리성 제약 조건($| ilde{d}_i - d_i| < d_{i au}$)을 통합함으로써 MPI Sintel 데이터셋에서 반복당 수렴 시간을 약 50% 감소시켰다(3.6초 → 1.72초)면서도 유사한 정확도를 유지한다.
  • 제한된 등거리성 제약 조건 하에서 60~70회 반복 내에 수렴함을 통해 사전 변형 범위 지식이 있는 경우 빠르고 신뢰할 수 있는 최적화가 가능함을 보여준다.
  • 이산적 평면 분해로 인한 블록 아티팩트가 존재하지만, TRW-S 기반 스무딩이 깊이의 연속성과 시각적 품질을 크게 향상시킨다.
  • 깊이 초기화의 중간 수준의 노이즈에 대해 강건하지만, 갑작스러운 객체 도착이나 제거 상황에는 취약하여 이러한 경우 재초기화가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.