Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Multi-view Alignment Network for Unsupervised Surface Registration

Wanquan Feng, Juyong Zhang|arXiv (Cornell University)|2020. 11. 24.
3D Shape Modeling and Analysis인용 수 7
한 줄 요약

이 논문은 비정상 표면 정합을 위한 순환 다중 시점 정렬 네트워크인 RMA-Net을 제안한다. 비정상 변형을 K개의 정상 변환의 점별 조합으로 표현하고, 지도 학습 없이도 끝에서 끝까지 훈련 가능한 다중 시점 2D 깊이 손실을 사용하여, 여러 데이터셋에서 대규모 및 미세한 변형에 대해 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Learning non-rigid registration in an end-to-end manner is challenging due to the inherent high degrees of freedom and the lack of labeled training data. In this paper, we resolve these two challenges simultaneously. First, we propose to represent the non-rigid transformation with a point-wise combination of several rigid transformations. This representation not only makes the solution space well-constrained but also enables our method to be solved iteratively with a recurrent framework, which greatly reduces the difficulty of learning. Second, we introduce a differentiable loss function that measures the 3D shape similarity on the projected multi-view 2D depth images so that our full framework can be trained end-to-end without ground truth supervision. Extensive experiments on several different datasets demonstrate that our proposed method outperforms the previous state-of-the-art by a large margin. The source codes are available at https://github.com/WanquanF/RMA-Net.

연구 동기 및 목표

  • 라벨이 부여된 대응 관계 없이 비정상 표면 정합을 위한 딥 네트워크를 훈련하는 데 도전하는 것.
  • 비정상 변형의 고차원 해 공간을 작은 수의 정상 변환 조합으로 표현하여 줄이는 것.
  • 끝에서 끝까지 훈련 가능한, 자가 지도 학습 손실 함수를 설계하여 다중 시점 깊이 이미지 유사도를 활용하는 것.
  • 대규모 및 미세한 변형, 특히 실제 스캔 데이터와 얼굴 표정에 대해 강력한 정합을 가능하게 하는 것.
  • 경쟁적인 성능을 보이며 정상 정합으로의 프레임워크 확장성을 입증하는 것.

제안 방법

  • 비정상 변형을 표면 점 수에 비해 작은 수인 K개의 정상 변환의 점별 가중 조합으로 표현한다.
  • 각 단계에서 변환 가중치와 정상 구성 요소를 반복적으로 추정하는 순환 신경망을 사용하여 단계별 복잡도를 감소시킨다.
  • 부드러운 래스터라이제이션을 사용하여 3D 표면을 다중 시점 2D 깊이 이미지 및 마스크로 투영하여 미분 가능성을 확보한다.
  • 원본 및 타겟 투영 간 깊이 및 마스크 유사도를 기반으로 다중 시점 정렬 손실을 정의한다.
  • 지표가 없는 상태에서 다중 시점 손실만을 사용하여 전체 네트워크를 끝에서 끝까지 비지도 학습한다.
  • 손실 계산을 위해 포인트 클라우드를 다중 시점 깊이 맵과 마스크로 변환하기 위해 부드러운 래스터라이제이션을 사용한다.

실험 결과

연구 질문

  • RQ1반복적으로 정상 변환 구성 요소를 개선함으로써 순환 네트워크가 복잡한 비정상 변형을 효과적으로 학습할 수 있는가?
  • RQ2지표 없이도 다중 시점 2D 깊이 이미지 유사도가 3D 비정상 정합에 강력하고 다중 시점으로 가능한 감독 신호가 될 수 있는가?
  • RQ3제안된 정상 변환의 점별 조합이 해 공간을 제약하면서도 충분한 표현력을 제공하는가?
  • RQ4이 방법은 합성 벤치마크를 넘어서 실제 스캔 데이터 및 대규모, 미세한 변형에 일반화 가능한가?
  • RQ5비정상 및 정상 정합 설정 모두에서 제안된 방법이 지도 및 비지도 기준선과 비교해 어떻게 성능을 내는가?

주요 결과

  • FaceWareHouse 데이터셋에서 RMA-Net은 모든 방법 중에서 가장 낮은 EMD(0.0024)와 MSE(0.0008)를 기록했으며, 열린 입을 닫는 데 유일하게 성공한 방법이었다.
  • DFAUST 데이터셋에서 RMA-Net은 0.24×10⁻⁴의 캐미어 거리(Chamfer Distance)를 달성하여 3D-Coded(0.43×10⁻⁴)를 크게 앞서며 미세한 기하학적 세부 정보를 유지했다.
  • ModelNet40에서 정상 정합을 위해 RMA-Net은 비지도 설정에서 RMSE(R)가 1.287로, 지도 변형에서는 0.735로 기록하여 ICP, Go-ICP, FGR, DCP를 모두 앞섰다.
  • 절단 분석 결과, 순환 아키텍처와 다중 시점 손실 모두가 필수적임을 확인했으며, 둘 중 하나를 제거하면 성능이 크게 떨어졌다.
  • 이전 방법이 높은 정밀도의 세부 정보를 포착하지 못했던 도전적인 대규모 변형, 즉 전신 및 얼굴 표정까지도 성공적으로 정합했다.
  • 표준 지표인 캐미어 거리와 어스 모버 디스턴스보다 다중 시점 손실이 네트워크 수렴을 정확한 해에 이르게 하는 데 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.