Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Joint Learning of Depth, Optical Flow, Ego-motion from Video

Jianfeng Li, Junqiao Zhao|arXiv (Cornell University)|2021. 05. 30.
Advanced Vision and Imaging참고 문헌 19인용 수 4
한 줄 요약

이 논문은 영상에서 깊이, 광학 흐름, 카메라 자세를 동시 추정하기 위한 자기지도 학습 프레임워크를 제안하며, 주목사용 기반 자세 네트워크, 동적 물체 마스킹, 에피포라 기하 제약 조건을 통해 정확도를 향상시킨다. KITTI 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 특히 광학 흐름 및 자세 추정에서 뛰어난 성능을 보이며, 깊이 결과 역시 경쟁력 있다.

ABSTRACT

Estimating geometric elements such as depth, camera motion, and optical flow from images is an important part of the robot's visual perception. We use a joint self-supervised method to estimate the three geometric elements. Depth network, optical flow network and camera motion network are independent of each other but are jointly optimized during training phase. Compared with independent training, joint training can make full use of the geometric relationship between geometric elements and provide dynamic and static information of the scene. In this paper, we improve the joint self-supervision method from three aspects: network structure, dynamic object segmentation, and geometric constraints. In terms of network structure, we apply the attention mechanism to the camera motion network, which helps to take advantage of the similarity of camera movement between frames. And according to attention mechanism in Transformer, we propose a plug-and-play convolutional attention module. In terms of dynamic object, according to the different influences of dynamic objects in the optical flow self-supervised framework and the depth-pose self-supervised framework, we propose a threshold algorithm to detect dynamic regions, and mask that in the loss function respectively. In terms of geometric constraints, we use traditional methods to estimate the fundamental matrix from the corresponding points to constrain the camera motion network. We demonstrate the effectiveness of our method on the KITTI dataset. Compared with other joint self-supervised methods, our method achieves state-of-the-art performance in the estimation of pose and optical flow, and the depth estimation has also achieved competitive results. Code will be available https://github.com/jianfenglihg/Unsupervised_geometry.

연구 동기 및 목표

  • 단일 영상에서 지도 학습 없이 깊이, 광학 흐름, 카메라 자세를 추정하는 과제를 해결한다.
  • 깊이, 흐름, 자세 간 기하 관계를 통합한 자기지도 학습을 통해 일반화 능력과 정확도를 향상시킨다.
  • 기존 자기지도 학습 방법의 한계를 극복하기 위해 동적 물체 처리, 주목사용 기반 기법, 기하 제약 조건을 통합한다.
  • 영상 프레임 간 시간적 운동 유사성을 모델링하여 자세 추정의 강인성을 향상시킨다.
  • 에피포라 기하를 활용한 강력한 기하 제약 조건을 도입하여 자세에서 광학 흐름으로의 오차 전파를 줄인다.

제안 방법

  • 카메라 운동의 시간적 유사성을 활용하기 위해 자세 네트워크에 플러그 앤 플레이형 컨volutional 주목사용 모듈을 도입한다.
  • 깊이-자세 및 광학 흐름 자기지도 학습에서 손실 함수에 동적 영역을 마스킹하기 위한 임계값 기반의 동적 영역 탐지 방법을 제안한다.
  • 흐름 추정 정확도를 햖스기 위해 정방향 및 역방향 광학 흐름 일致성 제약 조건을 적용한다.
  • 8점 알고리즘을 통해 에피포라 기하를 통합하여 광학 흐름과 추정된 카메라 자세 간 기하 일致성을 강제한다.
  • 이미지 재구성 손실을 워핑을 통해 적용하여 지도 학습 레이블 없이도 자기지도 학습을 가능하게 한다.
  • 일致성 및 기하 제약 조건이 강화된 다중 작업 손실을 통해 깊이, 광학 흐름, 자세 네트워크를 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1시간적 유사성을 모델링함으로써 주목사용 기반 기법이 자기지도 학습 자세 추정의 정확도를 향상시킬 수 있는가?
  • RQ2동적 물체는 어떻게 효과적으로 탐지하고 지도 학습에서 제외시켜 깊이 및 흐름 추정 오차를 줄일 수 있는가?
  • RQ3자기지도 학습 환경에서 에피포라 기하 제약 조건이 광학 흐름과 자세 추정 간 일치성을 향상시킬 수 있는가?
  • RQ4기하 및 일치성 제약 조건을 통합한 통합 자기지도 학습이 독립적 또는 단순한 통합 학습보다 성능 향상에 기여하는가?
  • RQ5기존 최신 기술 수준의 자기지도 학습 방법에 비해 제안된 방법이 KITTI와 같은 표준 벤치마크에서 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • 제안된 방법은 KITTI 2015에서 광학 흐름 추정에서 최신 기술 수준의 성능을 달성하였으며, 'all' 스플릿에서 5.66%의 오차율, 'bg' 스플릿에서 18.57%의 오차율을 기록하였다.
  • 주목사용 모듈 덕분에 자세 추정 성능이 크게 향상되어 기준 모델 및 이전의 통합 방법보다 오차가 감소하였다.
  • 교차 작업 일치성 손실($L_c^{df}$)과 기하 제약 조건($L_g$)을 추가함으로써 깊이 추정 성능이 향상되었으며, KITTI Eigen 스플릿에서 절대 상대 오차가 0.138로 감소하였다.
  • 특히 막힘 및 운동 오차 처리 능력에서 GLNet 및 기타 통합 자기지도 학습 기반 모델보다 성능이 뛰어나다.
  • 정성적 결과는 복잡한 환경에서도 정확한 깊이 예측을 보이며, 무늬 변화 및 운동에 대한 강인성을 입증하는 시각화 결과를 제공한다.
  • 절단 분석 결과, 주목사용, 동적 마스킹, 기하 제약 조건 각각의 구성 요소가 성능 향상에 점진적으로 기여하고 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.