Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Independent Object Motion from Unlabelled Stereoscopic Videos

Zhe Cao, Abhishek Kar|arXiv (Cornell University)|2019. 01. 07.
Advanced Vision and Imaging참고 문헌 47인용 수 7
한 줄 요약

이 논문은 3D 시나리오 플로우와 깊이를 예측하기 위해 유독한 스테레오 영상 시퀀스에서 2D 객체 박스만을 약한 사전 지식으로 활용하는 자기지도 학습 딥 러닝 프레임워크를 제안한다. 이 방법은 평면 스위프트 볼륨과 인스턴스 인식 기반 기하 일관성 손실을 사용하여 깊이, 객체별 3D 운동, 인스턴스 마스크를 동시에 추정하며, 운동 또는 깊이의 진짜 레이블 없이도 KITTI 벤치마크에서 깊이, 옵티컬 플로우, 시나리오 플로우 분야에서 최고 성능을 달성한다.

ABSTRACT

We present a system for learning motion of independently moving objects from stereo videos. The only human annotation used in our system are 2D object bounding boxes which introduce the notion of objects to our system. Unlike prior learning based work which has focused on predicting dense pixel-wise optical flow field and/or a depth map for each image, we propose to predict object instance specific 3D scene flow maps and instance masks from which we are able to derive the motion direction and speed for each object instance. Our network takes the 3D geometry of the problem into account which allows it to correlate the input images. We present experiments evaluating the accuracy of our 3D flow vectors, as well as depth maps and projected 2D optical flow where our jointly learned system outperforms earlier approaches trained for each task independently.

연구 동기 및 목표

  • 밀도 있는 지도 학습 없이도 비정상적인 스테레오 영상 시퀀스에서 독립적인 3D 객체 운동과 깊이를 학습하는 것.
  • 2D 객체 박스만을 약한 지도로 사용하여 정확한 3D 시나리오 플로우 및 깊이 예측을 가능하게 하는 것.
  • 3D 구조를 평면 스위프트 볼륨을 통해 인코딩하는 기하학적으로 인식하는 네트워크 아키텍처를 설계하여 시나리오 추론을 향상시키는 것.
  • 이미지 일관성의 주된 학습 신호를 사용하여 깊이, 3D 시나리오 플로우, 인스턴스 세그멘테이션을 동시에 최적화하는 것.
  • 통합 학습이 개별 학습보다 각 하위 작업(깊이, 플로우, 인스턴스 세그멘테이션)의 성능을 향상시킨다는 것을 입증하는 것.

제안 방법

  • 네트워크는 시야 간 및 시간 간의 3D 기하 관계를 인코딩하기 위해 스테레오 이미지 쌍을 평면 스위프트 볼륨을 사용하여 처리한다.
  • 오프더쇼프 검출기로부터 온 객체 수준의 지도를 활용하여 단일 순방향 전파에서 객체별 3D 시나리오 플로우, 깊이 맵, 인스턴스 마스크를 예측한다.
  • 새로운 일관성 손실이 각 객체 제안 영역(RoI)에 적용된다: 예측된 플로우와 깊이에서 재구성된 이미지 패치를 원본 입력 패치와 비교하여 기하 일관성을 강제한다.
  • 스테레오 재투영 손실을 사용하여 깊이 예측을 지도함으로써 왜곡된 이미지가 원본 입력과 일치하도록 보장한다.
  • U-넷 아키텍처를 사용하여 왜곡된 이미지와 플로우를 개선하는 별도의 정밀화 네트워크를 적용하여 옵티컬 플로우 예측을 향상시킨다.
  • 전체 시스템은 이미지 재구성 손실과 2D 객체 박스에서 온 약한 인스턴스 수준 지도만을 사용하여 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ12D 객체 박스만을 약한 지도로 사용하여 유독한 스테레오 영상에서 정확한 3D 시나리오 플로우와 깊이를 예측할 수 있는가?
  • RQ2깊이, 3D 플로우, 인스턴스 세그멘테이션의 통합 학습이 개별 학습보다 모든 하위 작업의 성능을 향상시키는가?
  • RQ3각 객체 제안 영역에 적용된 기하 일관성 손실이 객체별 3D 운동 예측에 효과적으로 지도 역할을 할 수 있는가?
  • RQ4제안된 방법은 깊이, 옵티컬 플로우, 시나리오 플로우 분야에서 KITTI 벤치마크에서 자기지도 학습 및 지도 학습 기반 기준과 비교해 어떻게 성능을 내는가?
  • RQ5모델은 합성 데이터나 밀도 높은 애너테이션에 의존하지 않고 실제 동적 환경에서도 일반화 가능한가?

주요 결과

  • KITTI 2015 스테레오 훈련 세트에서 시험 시 깊이 오차(RMSE)가 3.896으로, 다른 자기지도 학습 및 고전적 방법보다 뛰어나다.
  • KITTI 2015 플로우 벤치마크에서 전체 영역의 평균 종단점 오차(EPE)는 5.39, 비가림 영역에서는 4.97을 기록하여 다른 자기지도 학습 방법을 능가한다.
  • 인스턴스 수준 IoU는 0.655, 이미지 수준 IoU는 0.782로 향상되어 이동 중인 객체의 정확한 탐지 및 세그멘테이션을 보여준다.
  • 3D 플로우를 2D로 투영했을 때, 자기지도 학습 방법 중에서 가장 낮은 EPE를 기록하며, 정밀화된 버전은 전체 영역에서 5.13 EPE를 달성한다.
  • 제거 실험 결과, RoI 일관성 손실을 제거하면 성능 저하가 발생함을 확인하여 이 손실의 중요성을 입증한다.
  • 기하 일관성 손실을 활용한 통합 학습은 개별적으로 각 작업을 학습시키는 것보다 깊이, 플로우, 인스턴스 세그멘테이션에서 더 높은 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.