Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Rigidity in Dynamic Scenes with a Moving Camera for 3D Motion Field Estimation

Zhaoyang Lv, Kihwan Kim|arXiv (Cornell University)|2018. 04. 12.
Advanced Vision and Imaging참고 문헌 26인용 수 12
한 줄 요약

이 논문은 움직이는 카메라로 촬영한 동적 환경에서 깊이 학습 프레임워크를 제안하여, 3차원 운동장(장면 흐름) 추정을 향상시키기 위해 동시에 강성과 카메라 운동을 추정한다. 반구조화된 RGB-D 데이터셋(REFRESH)을 활용함으로써, 픽셀 단위의 강성 마스크를 예측하고, 광학 흐름 및 강성 영역을 통해 자가 운동을 정밀하게 보정하여, 심한 비강성 운동을 포함한 도전적인 동적 환경에서 최신 기술을 능가한다.

ABSTRACT

Estimation of 3D motion in a dynamic scene from a temporal pair of images is a core task in many scene understanding problems. In real world applications, a dynamic scene is commonly captured by a moving camera (i.e., panning, tilting or hand-held), increasing the task complexity because the scene is observed from different view points. The main challenge is the disambiguation of the camera motion from scene motion, which becomes more difficult as the amount of rigidity observed decreases, even with successful estimation of 2D image correspondences. Compared to other state-of-the-art 3D scene flow estimation methods, in this paper we propose to \emph{learn} the rigidity of a scene in a supervised manner from a large collection of dynamic scene data, and directly infer a rigidity mask from two sequential images with depths. With the learned network, we show how we can effectively estimate camera motion and projected scene flow using computed 2D optical flow and the inferred rigidity mask. For training and testing the rigidity network, we also provide a new semi-synthetic dynamic scene dataset (synthetic foreground objects with a real background) and an evaluation split that accounts for the percentage of observed non-rigid pixels. Through our evaluation we show the proposed framework outperforms current state-of-the-art scene flow estimation methods in challenging dynamic scenes.

연구 동기 및 목표

  • 움직이는 카메라로 촬영한 동적 환경에서 카메라 운동과 장면 운동을 구분하는 데 도전하는 것.
  • 이미지 쌍의 깊이 정보를 활용해 픽셀 단위의 강성 예측을 통해 3차원 운동장(장면 흐름) 추정을 향상시키는 것.
  • 실제 배경과 합성된 움직이는 정적 배경을 결합한 확장 가능한 반구조화된 데이터셋(REFRESH)을 개발하여 더 나은 감독과 일반화를 가능하게 하는 것.
  • 학습된 강성 정보를 2차원 광학 흐름과 통합하여 자가 운동과 투영된 장면 흐름을 정확하게 추정하는 것.

제안 방법

  • 순차적인 RGB-D 이미지 쌍을 처리하기 위해 이중 스트림 신경망 아키텍처를 사용하여 강성 마스크와 상대적 카메라 자세를 동시에 예측한다.
  • 강성 마스크를 활용해 강성 영역 내에서 조밀한 흐름 대응 관계에 대해 최소 제곱 최적화를 수행함으로써 추정된 카메라 자세를 정밀화한다.
  • 흐름 정밀화 모듈은 강성 마스크와 광학 흐름을 활용하여 3차원 운동장 계산을 위한 대응 정확도를 향상시킨다.
  • 실제 정적 배경과 합성된 비강성 인간 운동을 조합한 반구조화된 데이터셋(REFRESH)을 사용하여 강성, 깊이, 흐름, 자세에 대한 정확한 진실값을 제공한다.
  • 대규모 동적 환경 데이터에서 지도 학습을 통해 프레임워크를 훈련시켜 RGB-D 입력에서 종단 간 추론이 가능한 3차원 장면 흐름 예측을 실현한다.
  • 다양한 장면 역학적 특성을 반영한 새로운 테스트 분할을 사용하여 비강성 픽셀 비율을 고려한 공정한 비교를 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크는 움직이는 카메라로 촬영한 동적 환경에서 3차원 운동장 추정을 향상시키기 위해 픽셀 단위의 강성을 효과적으로 예측할 수 있는가?
  • RQ2반구조화된 데이터에서 학습한 강성 정보가 노이즈와 운동 흐림이 있는 실제 RGB-D 시퀀스에 어떻게 일반화되는가?
  • RQ3강성 인식 자세 정밀화를 통합할 경우, 최신 기술 대비 장면 흐름 정확도는 어느 정도 향상되는가?
  • RQ4학습된 강성 마스크는 기하학적 사전 지식이나 군집화에 의존하는 전통적 방법보다 더 나은 성능을 보일 수 있는가?
  • RQ5특히 장면의 소수 부분만 강성일 경우, 다양한 비강성 운동 수준에서 제안된 프레임워크는 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 방법은 Sintel 및 TUM RGB-D 벤치마크에서 최신 기술 대비 뛰어난 성능을 보이며, 높은 동적 콘텐츠를 포함한 장면에서 특히 두각을 나타낸다.
  • Sintel 데이터셋에서 평균 RPE(t)는 0.0091, RPE(r)는 0.0020을 기록하여 ORB-SLAM(0.0894 및 0.0218)과 SRSF(0.0980 및 0.0180)를 크게 앞서나간다.
  • REFRESH 데이터셋에서 훈련된 강성 마스크는 평균 IOU 0.956을 달성하여, Things3D(0.286) 또는 의미론적 강성 기반 기준 모델 대비 뛰어난 일반화 능력을 입증한다.
  • TUM 시퀀스에서 얻은 실제 노이즈가 있는 RGB-D 데이터에 대해서도 잘 일반화되어 있으며, 운동 흐림과 깊이 노이즈가 존재하더라도 타당한 강성 예측과 장면 흐름을 생성한다.
  • 제거 실험 결과, 미세조정 없이도 모든 최신 기술을 능가하는 성능을 보이며, 자세 추정과 장면 흐름 예측에서 가장 높은 정확도를 확보한다.
  • 소형 또는 느리게 움직이는 물체가 있는 도전적인 상황에서도 강인한 성능을 보이며, 강성 예측 오류가 최소화되고 3차원 운동장 품질에 크게 영향을 주지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.