[논문 리뷰] REGTR: End-to-end Point Cloud Correspondences with Transformers
REGTR는 근접 이웃 매칭이나 RANSAC에 의존하지 않고, 변환기를 사용하여 깔끔하고 일관된 대응 관계를 직접 예측하는 엔드 투 엔드 포인트 클러스터 레지지스트레이션 프레임워크를 제안한다. 위치 인코딩을 활용한 멀티헤드 자기 및 크로스 어텐션 메커니즘을 통해 3DMatch 및 ModelNet 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 더 빠른 추론과 향상된 내구성을 확보한다.
Despite recent success in incorporating learning into point cloud registration, many works focus on learning feature descriptors and continue to rely on nearest-neighbor feature matching and outlier filtering through RANSAC to obtain the final set of correspondences for pose estimation. In this work, we conjecture that attention mechanisms can replace the role of explicit feature matching and RANSAC, and thus propose an end-to-end framework to directly predict the final set of correspondences. We use a network architecture consisting primarily of transformer layers containing self and cross attentions, and train it to predict the probability each point lies in the overlapping region and its corresponding position in the other point cloud. The required rigid transformation can then be estimated directly from the predicted correspondences without further post-processing. Despite its simplicity, our approach achieves state-of-the-art performance on 3DMatch and ModelNet benchmarks. Our source code can be found at https://github.com/yewzijian/RegTR .
연구 동기 및 목표
- 포인트 클러스터 레지지스트레이션에서 RANSAC 및 근접 이웃 특징 매칭과 같은 후처리 단계가 필요 없도록 하기 위해.
- 어텐션 메커니즘이 분류 가능한 특징을 학습하는 대신 직접 최종 대응 관계를 예측할 수 있는지 조사하기 위해.
- 청소되고 강성 일관성이 확보된 대응 관계를 엔드 투 엔드로 출력하도록 모델을 훈련시켜 레지지스트레이션 정확도와 효율성을 향상시키기 위해.
- 고해상도 키포인트 샘플링과 특징 엔지니어링에 대한 의존도를 줄이기 위해 격자 기반으로 샘플링된 포인트와 어텐션 기반 대응 예측을 사용하기 위해.
- 변환기를 통한 직접적인 대응 관계 예측이 RANSAC를 포함한 전통적인 파이프라인보다 우수한 성능을 보이는지 입증하기 위해.
제안 방법
- 입력 포인트 클러스터를 다운샘플링하고 초기 특징을 추출하기 위해 포인트 컨볼루션 백본을 사용한다.
- 다중 헤드 자기 및 크로스 어텐션을 갖춘 다중 트랜스포머 레이어를 활용하여 전역적 맥락을 통합하고, 위치 인코딩을 통해 강성 제약 조건을 강제한다.
- 다운샘플된 각 포인트에 대해 다음을 예측한다: (1) 다른 포인트 클러스터 내에서의 해당 포인트의 위치, (2) 겹침 확률 점수.
- 다양체적 최소 제곱 해법을 사용하여 예측된 대응 관계에서 직접 최종 강성 변환을 추정한다.
- 최종 트랜스포머 레이어에서의 원형 손실(Circle Loss)과 함께 겹침 손실($\mathcal{L}_o$)과 특징 손실($\mathcal{L}_f$)의 조합을 사용하여 네트워크를 훈련시킨다.
- 중간 레이어에 대한 감독을 피하기 위해 성능 저하를 방지하고, 손실은 오직 최종 출력 레이어에만 적용한다.
실험 결과
연구 질문
- RQ1변환기의 자기 및 크로스 어텐션 메커니즘이 명시적인 특징 매칭 없이도 최종 포인트 대응 관계를 직접 예측할 수 있는가?
- RQ2대응 관계 예측을 위한 트랜스포머 기반 네트워크의 엔드 투 엔드 훈련이 RANSAC를 포함한 기존 파이프라인보다 더 높은 레지지스트레이션 정확도를 달성할 수 있는가?
- RQ3표준 벤치마크에서 직접 대응 관계 예측의 성능이 근접 이웃 매칭 및 RANSAC에 의존하는 방법과 비교해 어떻게 되는가?
- RQ4다양한 손실 함수와 감독 전략이 예측된 대응 관계의 품질에 어떤 영향을 미치는가?
- RQ5다운샘플된 격자 기반 포인트를 사용할 때, 더 단순한 직접 예측 접근 방식이 복잡한 특징 학습 파이프라인을 능가할 수 있는가?
주요 결과
- REGTR는 3DMatch 벤치마크에서 92.0%의 레지지스트레이션 리콜을 달성하여 이전의 SOTA를 초월하고 RANSAC 기반 베이스라인을 능가한다.
- 3DLoMatch 데이터셋에서 REGTR는 64.8%의 레지지스트레이션 리콜을 기록하여 낮은 겹침 영역을 가진 도전적인 시나리오에 대해서도 강력한 일반화 성능을 보였다.
- 3DMatch에서 회전 오차는 1.567°로 줄이고, 이동 오차는 0.049m로 줄여 RANSAC 기반 베이스라인과 특징 매칭 접근 방식을 모두 능가했다.
- 절단 실험 결과, 특징 손실을 제거하면 3DMatch에서 레지지스트레이션 리콜이 1.6% 감소하여 이 손실이 정확한 대응 관계 예측에 중요함을 입증했다.
- 모든 트랜스포머 레이어에 손실를 적용할 경우 3DMatch에서 성능이 8.1% 저하되어 최종 레이어에만 감독을 적용하는 것이 최적임을 확인했다.
- REGTR의 예측된 대응 관계에 RANSAC를 적용해도 결과가 약간 악화되어, 예측된 대응 관계가 이미 일관되고 내구성이 있음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.