Skip to main content
QUICK REVIEW

[논문 리뷰] Attentional Separation-and-Aggregation Network for Self-supervised Depth-Pose Learning in Dynamic Scenes

Feng Gao, Jincheng Yu|arXiv (Cornell University)|2020. 11. 18.
Advanced Vision and Imaging인용 수 7
한 줄 요약

이 논문은 동적인 환경에서 자기지도 학습을 통한 단안 영상의 깊이 및 자율 주행 운동 추정을 위한 주의 기반 분리 및 집합 네트워크(ASANet)를 제안한다. 주의 메커니즘을 사용하여 정적 및 동적 환경 특징을 분리한다. 자율 선택 메커니즘을 도입하여 정적 영역에는 자율 주행 운동을, 움직이는 물체에는 운동장면을 적용함으로써 KITTI에서 최고 성능을 달성하면서도 계산 오버헤드를 최소화한다.

ABSTRACT

Learning depth and ego-motion from unlabeled videos via self-supervision from epipolar projection can improve the robustness and accuracy of the 3D perception and localization of vision-based robots. However, the rigid projection computed by ego-motion cannot represent all scene points, such as points on moving objects, leading to false guidance in these regions. To address this problem, we propose an Attentional Separation-and-Aggregation Network (ASANet), which can learn to distinguish and extract the scene's static and dynamic characteristics via the attention mechanism. We further propose a novel MotionNet with an ASANet as the encoder, followed by two separate decoders, to estimate the camera's ego-motion and the scene's dynamic motion field. Then, we introduce an auto-selecting approach to detect the moving objects for dynamic-aware learning automatically. Empirical experiments demonstrate that our method can achieve the state-of-the-art performance on the KITTI benchmark.

연구 동기 및 목표

  • 단안 영상에서 움직이는 물체가 자기지도 학습 기반 깊이 및 자율 주행 운동 추정에 영향을 미치는 문제를 해결하기 위해.
  • 외부 애너테이션이나 사전 학습된 세분화 모델에 의존하지 않고도 동적 환경에 적응하는 학습을 가능하게 하기 위해.
  • 순수 자기지도 학습 하에 깊이, 자율 주행 운동, 운동장면을 동시에 추정할 수 있는 경량이며 종단 간(end-to-end) 시스템을 개발하기 위해.
  • 낮은 파라미터 수와 실시간 추론 속도를 확보하면서 KITTI에서 최고 성능을 달성하기 위해.

제안 방법

  • ASANet는 각 레이어에서 소프트 주의 기반 분해를 통해 정적 및 동적 특징을 별도로 처리하기 위한 공유 가중치를 가진 두 개의 특징 경로를 사용한다.
  • 특징들은 경로 간 집합을 통해 반복적인 분리 및 집합 연산을 통해 표현을 정교화한다.
  • MotionNet 아키텍처는 ASANet을 인코더로 사용하고, 자율 주행 운동 및 동적 운동장면 추정을 위한 두 개의 디코더를 갖는다.
  • 자율 선택 메커니즘은 움직이는 물체를 동적으로 식별하고, 감독 신호 구축을 위해 적절한 변환(자율 주행 운동 또는 운동장면)을 적용한다.
  • 감독 품질 향상을 위해 에피포라 일致성 손실과 기하학적 일치 정규화(L_ge)를 활용한다.
  • 다단계 학습 스케줄을 사용하여 동적 환경에 적응하는 특징 학습을 점진적으로 개선한다.

실험 결과

연구 질문

  • RQ1외부 감독 없이 주의 기반 네트워크가 단안 영상에서 정적 및 동적 환경 구성 요소를 효과적으로 분리할 수 있는가?
  • RQ2임의의 움직이는 물체가 존재하는 환경에서 자기지도 학습 기반 깊이 및 자율 주행 운동 추정을 어떻게 향상시킬 수 있는가?
  • RQ3학습 중에 자율 선택 메커니즘이 다양한 환경 영역에 대해 적절한 변환(자율 주행 운동 대비 운동장면)을 동적으로 할당할 수 있는가?
  • RQ4제안된 방법이 기존 방법보다 계산 비용을 낮추면서도 최고 성능을 달성하는가?

주요 결과

  • 제안된 방법은 KITTI 벤치마크에서 최고 성능을 달성하여, 깊이 추정 및 시각적 오도메트리 작업에서 Monodepth2와 PackNet-SfM를 모두 능가한다.
  • ResNet-18 백본을 사용할 경우, KITTI에서 절대 상대 오차(Abs Rel) 0.112, 제곱 상대 오차(Sq Rel) 0.867, δ1.25 0.882를 기록하며, 기준 모델인 Monodepth2를 초월한다.
  • ASANet와 자율 선택 메커니즘을 추가함으로써 Abs Rel은 0.003 감소하고 δ1.25는 0.005 향상된다.
  • 모델은 50 fps로 실시간 추론을 유지하며, ORB-SLAM2보다 훨씬 빠르고, 다른 단일 단계 종단 간 방법과 경쟁 가능하다.
  • ResNet-18 기반으로 14.84M 파라미터만을 사용하여, PackNet-SfM(D=4 기준 78.49M)의 절반 이하 크기로도 뛰어난 성능을 달성한다.
  • 더 깊은 ResNet-50를 사용할 경우에도 자율 선택 메커니즘이 성능 향상에 일관되게 기여하며, Abs Rel을 0.109에서 0.108로 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.