Skip to main content
QUICK REVIEW

[논문 리뷰] COTR: Correspondence Transformer for Matching Across Images

Wei Jiang, Eduard Trulls|arXiv (Cornell University)|2021. 03. 25.
Advanced Vision and Imaging참고 문헌 72인용 수 8
한 줄 요약

COTR는 다중 해상도 추론과 자기주의를 활용하여 국소적 및 전역적 사전 지식을 모델링하는 트랜스포머 기반 대응 네트워크를 소개한다. 이는 기능 매핑을 통한 이미지 간 희소 또는 조밀한 대응을 예측하며, 재학습 없이도 다양한 작업—광범위한 기준 스테레오, 광학 흐름, 객체 중심 시나리오—에서 최신 기술 성능을 달성한다.

ABSTRACT

We propose a novel framework for finding correspondences in images based on a deep neural network that, given two images and a query point in one of them, finds its correspondence in the other. By doing so, one has the option to query only the points of interest and retrieve sparse correspondences, or to query all points in an image and obtain dense mappings. Importantly, in order to capture both local and global priors, and to let our model relate between image regions using the most relevant among said priors, we realize our network using a transformer. At inference time, we apply our correspondence network by recursively zooming in around the estimates, yielding a multiscale pipeline able to provide highly-accurate correspondences. Our method significantly outperforms the state of the art on both sparse and dense correspondence problems on multiple datasets and tasks, ranging from wide-baseline stereo to optical flow, without any retraining for a specific dataset. We commit to releasing data, code, and all the tools necessary to train from scratch and ensure reproducibility.

연구 동기 및 목표

  • 희소 및 조밀한 대응 방법 간 격차를 해소하기 위해, 동일한 미분 가능한 프레임워크 아래에서 둘을 통합하는 것.
  • 임의의 쿼리 포인트에 대해 정확한 대응 예측을 가능하게 하여 희소 및 조밀 추론을 모두 지원하는 것.
  • 3D 기하학으로 인한 불연속성 등을 포함한 복잡한 대응 패턴을 주의 메커니즘을 사용해 모델링하는 것.
  • 반복적 정밀 조정을 통해 국소화 정확도를 향상시키는 재귀적 다중 해상도 추론 전략을 개발하는 것.
  • 세부 조정 또는 아키텍처 변경 없이도 다양한 데이터셋과 작업으로의 일반화 성능을 입증하는 것.

제안 방법

  • COTR는 대응을 기능 매핑으로 공식화한다: $ x' = \mathcal{F}_{\Phi}(x \mid I, I') $, 여기서 $ \mathcal{F}_{\Phi} $ 는 첫 번째 이미지의 쿼리 포인트 $ x $ 를 기반으로 두 번째 이미지의 대응 포인트 $ x' $ 를 예측하는 트랜스포머 기반 네트워크이다.
  • 쿼리 위치와 이미지 특징 간의 교차 주의를 사용하여 관련된 전역적 및 국소적 맥락에 주의를 기울이며, 이는 큰 이동과 복잡한 운동을 처리할 수 있도록 한다.
  • 추론 시 재귀적 줌 인 메커니즘이 적용된다: 모델은 예측된 대응 주변의 더 작은 영역에 집중하여 예측을 정밀하게 개선한다.
  • 예측된 대응과 진짜 값 간의 끝에서 끝까지의 픽셀 오차(EPE)를 최소화하는 미분 가능한 손실 함수를 사용해 네트워크를 훈련시킨다.
  • 예측 후에 낮은 신뢰도의 대응을 제거하는 필터링 메커니즘이 적용되어 조밀한 보간 품질을 향상시킨다.
  • Transformer를 다층 퍼셉트론(MLP)으로 대체하여 아키텍처를 분석함으로써, 불연속적인 대응을 모델링하기 위해 주의 기반 구조가 필수적임을 입증한다.

실험 결과

연구 질문

  • RQ1아키텍처나 훈련 재구성 없이도 단일 딥러닝 프레임워크가 희소 및 조밀한 대응 작업을 효과적으로 처리할 수 있는가?
  • RQ2특히 기하학적 불연속성이 존재할 경우, 트랜스포머의 자기주의 메커니즘이 완전히 연결된 또는 MLP 기반 모델보다 대응 추정 성능을 어떻게 향상시키는가?
  • RQ3재귀적 다중 해상도 정밀 조정 전략이 대응 예측 정확도에 얼마나 기여하는가?
  • RQ4모델은 미세 조정 없이도 새로운 데이터셋과 운동 유형(예: 다중 객체 운동 또는 객체 자세 변화)으로 일반화 가능한가?
  • RQ5낮은 신뢰도의 대응을 필터링하는 것이 조밀한 대응 맵 품질에 어떤 영향을 미치는가?

주요 결과

  • COTR는 재학습 없이도 HPatches, KITTI, ETH3D, IMC2020 데이터셋에서 희소 및 조밀한 대응 작업 모두 최신 기술 성능을 달성한다.
  • HPatches 데이터셋에서 COTR는 512개의 입력 매칭으로만 SuperGlue(2k-키포인트 카테고리 우승자)를, 256개의 매칭으로만 DISK(2위)를 능가한다.
  • 재귀적 줌 인 전략은 끝에서 끝까지의 픽셀 오차(EPE)를 크게 감소시키며, 오차 분포가 왼쪽으로 이동하고 높은 줌 수준에서 더욱 집중된다.
  • 아블레이션 연구 결과, 트랜스포머를 MLP로 대체할 경우 전역적으로 부드러운 예측이지만, 특히 객체 경계에서 기하학적으로 정확하지 못한 결과를 보였다.
  • ETH3D에서 낮은 신뢰도의 대응을 필터링하면 AEPE가 약 5% 상승하며, 평균적으로 예측의 1.2%만 제거된다.
  • 정성적 결과는 COTR가 객체 교환 및 비평면 3D 구조와 같은 복잡한 운동을 성공적으로 포착하는 반면, GLU-Net과 같은 기준 모델은 실패함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.