Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Learnable Geometric Vision by Backpropagating PnP Optimization

Bo Chen, Álvaro Parra|arXiv (Cornell University)|2019. 09. 13.
Advanced Vision and Imaging참고 문헌 56인용 수 5
한 줄 요약

이 논문은 암시적 미분을 통해 PnP 최적화를 거쳐 엔드 투 엔드 백프로파게이션을 가능하게 하는 미분 가능한 PnP 솔버인 BPnP를 소개한다. PnP 솔버를 통해 정확하게 기울기를 계산함으로써 BPnP는 신경망 특징, 카메라 자세, 3D 구조의 공동 학습을 허용하며, 히트맵과 재투영 감독을 조합한 손실을 사용하여 객체 자세 추정에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Deep networks excel in learning patterns from large amounts of data. On the other hand, many geometric vision tasks are specified as optimization problems. To seamlessly combine deep learning and geometric vision, it is vital to perform learning and geometric optimization end-to-end. Towards this aim, we present BPnP, a novel network module that backpropagates gradients through a Perspective-n-Points (PnP) solver to guide parameter updates of a neural network. Based on implicit differentiation, we show that the gradients of a "self-contained" PnP solver can be derived accurately and efficiently, as if the optimizer block were a differentiable function. We validate BPnP by incorporating it in a deep model that can learn camera intrinsics, camera extrinsics (poses) and 3D structure from training datasets. Further, we develop an end-to-end trainable pipeline for object pose estimation, which achieves greater accuracy by combining feature-based heatmap losses with 2D-3D reprojection errors. Since our approach can be extended to other optimization problems, our work helps to pave the way to perform learnable geometric vision in a principled manner. Our PyTorch implementation of BPnP is available on http://github.com/BoChenYS/BPnP.

연구 동기 및 목표

  • 딥 네트워크의 엔드 투 엔드 훈련을 가능하게 하여 자세 추정, 3D 복원, 카메라 캘리브레이션과 같은 기하학적 시각 작업을 공동 최적화하는 것.
  • PnP와 같이 비미분 가능한 기하 최적화 솔버를 통해 기울기를 백프로파게이션하는 문제를 해결하는 것.
  • 딥 특징 학습을 기존의 기하 최적화 방법과 통합된, 유일하고 미분 가능한 파이프라인으로 통합하는 것.
  • 2D-3D 재투영 오차와 히트맵 감독을 통합하여 객체 자세 추정 모델의 성능을 향상시키는 것.
  • 딥 러닝에서 미분 가능한 기하 최적화를 위한 일반화 가능한 프레임워크를 제공하는 것.

제안 방법

  • BPnP는 중심 차분과 같은 근사 수치 방법을 피하기 위해 암시적 미분을 사용하여 자체 포함된 PnP 솔버를 통해 기울기를 분석적으로 계산한다.
  • 최적화의 KKT 조건의 암시적 방정식을 풀어 입력 특징에 대한 PnP 해의 기울기를 유도한다.
  • 딥 신경망에 통합된 미분 가능한 PnP 레이어를 통해 특징 추출기와 기하 최적화 블록 양쪽 모두를 통해 백프로파게이션을 허용한다.
  • 엔드 투 엔드 백프로파게이션을 통해 3D 구조, 카메라 자세, 내재 매개변수의 공동 최적화를 지원한다.
  • 특징 표현 학습을 향상시키기 위해 히트맵 회귀와 2D-3D 재투영 오차를 조합한 혼합 손실을 사용한다.
  • 구현은 PyTorch에 공개되어 있어 기존의 딥 러닝 파이프라인에 쉽게 통합할 수 있다.

실험 결과

연구 질문

  • RQ1PnP 솔버를 통해 정확하고 효율적으로 기울기를 백프로파게이션할 수 있는가? 이는 기하학적 시각 작업을 위한 딥 네트워크의 엔드 투 엔드 훈련을 가능하게 하는가?
  • RQ2히트맵 감독과 2D-3D 재투영 오차를 조합하면 객체 자세 추정 모델의 성능에 어떤 영향을 미치는가?
  • RQ3미분 가능한 PnP 레이어는 엔드 투 엔드 학습 프레임워크에서 3D 구조, 카메라 자세, 내재 매개변수 추정의 정확도를 향상시킬 수 있는가?
  • RQ4일반화성과 강건성 측면에서 BPnP는 최신 기술 수준의 엔드 투 엔드 자세 추정 방법과 비교해 어떻게 성능을 내는가?
  • RQ5암시적 미분은 시각 분야의 다른 기하 최적화 문제에 얼마나 광범위하게 적용될 수 있는가?

주요 결과

  • BPnP 모듈은 수치 근사의 계산 비용을 피하기 위해 암시적 미분을 사용하여 PnP 솔버를 통해 정확하고 효율적인 기울기 계산을 가능하게 한다.
  • LINEMOD 데이터셋에서 혼합 손실($\ell_m$)을 사용해 훈련한 모델은 평균 ADD(-S) 정확도 93.27%를 달성했으며, 히트맵($\ell_h$: 93.27% 대비 92.27%) 또는 재투영($\ell_p$: 85.12%) 손실만 사용한 모델보다 뛰어난 성능을 보였다.
  • 엄격한 2픽셀 임계값 조건 하에서 혼합 손실은 평균 2D 투영 정확도 90.79%를 기록했으며, 순수 히트맵 손실(90.12%)과 재투영 전용 손실(86.56%)보다 뚜렷이 뛰어났다.
  • BPnP 기반 파이프라인은 더 적은 훈련 이미지와 데이터 증강 없이도 객체 자세 추정에서 최신 기술 수준의 성능을 달성했으며, 현재의 SOTA 방법인 PVNet을 능가했다.
  • 기하 제약 조건(재투영 오차)의 통합은 특징 학습을 크게 향상시켰으며, 이는 혼합 손실이 히트맵 전용 감독보다 뛰어난 성능을 보임으로써 입증되었다.
  • 이 방법은 일반화 가능하며, 스테레오 복원 및 카메라 캘리브레이션과 같은 다른 기하 최적화 문제로도 확장 가능하여 엔드 투 엔드로 미분 가능한 기하 파이프라인을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.