Skip to main content
QUICK REVIEW

[논문 리뷰] ROCA: Robust CAD Model Retrieval and Alignment from a Single Image

Can Gümeli, Angela Dai|arXiv (Cornell University)|2021. 12. 03.
3D Surveying and Cultural Heritage인용 수 5
한 줄 요약

ROCA는 밀도 있는 2D-3D 대응 관계(깊이 및 정규화된 객체 좌표)를 기반으로 하는 미분 가능 Procrustes 최적화를 사용하여 단일 RGB 이미지에서 강력한 3D CAD 모델 검색 및 9-DoF 자세 정렬을 위한 엔드 투 엔드 방법을 제안한다. 기하학적 임베딩과 함께 학습된 자세 최적화를 통해 ROCA는 ScanNet에서 검색 인식 정확도를 17.6%로 향상시켰으며, 기존 최고 성능(SOTA) 대비 8.1% 상대적 향상률을 기록하였다.

ABSTRACT

We present ROCA, a novel end-to-end approach that retrieves and aligns 3D CAD models from a shape database to a single input image. This enables 3D perception of an observed scene from a 2D RGB observation, characterized as a lightweight, compact, clean CAD representation. Core to our approach is our differentiable alignment optimization based on dense 2D-3D object correspondences and Procrustes alignment. ROCA can thus provide a robust CAD alignment while simultaneously informing CAD retrieval by leveraging the 2D-3D correspondences to learn geometrically similar CAD models. Experiments on challenging, real-world imagery from ScanNet show that ROCA significantly improves on state of the art, from 9.5% to 17.6% in retrieval-aware CAD alignment accuracy.

연구 동기 및 목표

  • 단일 RGB 이미지에서 경량이고 컴팩트한 CAD 모델을 활용해 실세계 환경의 정확한 3D 인식을 가능하게 하기 위해.
  • 3D 객체 정렬에서 직접 자세 회귀의 한계를 해결하기 위해, 기하학적 정보를 반영한 미분 가능한 최적화 과정을 도입하기 위해.
  • 3D 기준 좌표와 보조 형태 복원 목표를 활용한 공동 임베딩을 학습하여 CAD 검색 성능을 향상시키기 위해.
  • 인터랙티브 응용 프로그램에 적합한 실시간 추론 성능를 달성하기 위해.
  • 실세계 영상에서 노이즈가 있거나 완벽하지 않은 2D-3D 대응 관계에 대한 강건성을 향상시키기 위해.

제안 방법

  • ROCA는 단일 RGB 이미지 내 객체를 검출하고 인스턴스 세그먼테이션하기 위해 Mask R-CNN 백본을 사용한다.
  • 이미지 영역과 기준 3D 객체 공간 간의 2D-3D 대응 관계를 설정하기 위해 픽셀 단위의 깊이 및 정규화된 객체 좌표(NOCs)를 예측한다.
  • 예측된 2D 투영과 기준 3D 점 사이의 오차를 최소화함으로써 9-DoF 강체 변환(이동 및 회전)을 계산하기 위해 미분 가능한 Procrustes 최적화를 적용한다.
  • 노이즈가 있는 대응 관계에 대한 강건성을 향상시키기 위해 Procrustes 최적화에 학습된 가중치를 통합한다.
  • NOC 예측과 보조 형태 복원 손실을 활용하여 검출된 객체 특징과 CAD 모델 간의 공동 임베딩 공간을 학습함으로써 검색 성능을 향상시킨다.
  • 전체 파이프라인은 엔드 투 엔드로 훈련되어 검출, 대응 예측, 자세 추정, 검색의 공동 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1미분 가능한 2D-3D 대응 예측이 단일 RGB 이미지에서 3D CAD 모델 정렬 정확도를 향상시킬 수 있는가?
  • RQ2기준 3D 좌표와 대응 예측에서 유도된 기하학적 정보를 반영한 임베딩이 CAD 검색 성능 향상에 기여하는가?
  • RQ3검색과 정렬의 엔드 투 엔드 공동 최적화가 분리된 접근 방식보다 더 높은 정렬 정확도를 달성하는가?
  • RQ4실세계 데이터에서 노이즈가 있거나 완벽하지 않은 2D-3D 대응 예측에 대해 이 방법이 얼마나 강건한가?
  • RQ5이 방법은 인터랙티브 응용 프로그램에 적합한 실시간 추론 속도를 달성할 수 있는가?

주요 결과

  • ROCA는 ScanNet/Scan2CAD 벤치마크에서 기존 SOTA의 9.5%에서 17.6%로 검색 인식 정확도를 크게 향상시켰다.
  • 미분 가능한 Procrustes 최적화 도입으로 클래스 정렬 정확도가 14.9%에서 19.4%로 상승하였다.
  • Procrustes 최적화에 학습된 가중치를 추가로 통합함으로써 정확도가 20.4%로 추가 향상되었다.
  • NOC 기반의 임베딩 공간을 활용한 학습된 검색 통합으로 정렬 정확도가 21.5%로 상승하였다.
  • NOC 예측에 시뮬레이션된 가우시안 노이즈가 적용된 상황에서도 강건성을 유지하였으며, σ=0.3일 때 기준 정확도의 90%를 유지하였다.
  • 훈련 데이터를 25k에서 400k 프레임으로 확장함으로써 정렬 정확도가 24.4%로 향상되었고, 검색 인식 정확도는 24.9%로 상승하여 데이터 효율성 향상을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.