[논문 리뷰] CATs: Cost Aggregation Transformers for Visual Correspondence
CATs는 시각적 대응에 대해 전역 자기주의를 활용하여 노이즈가 많은 초기 상관도 맵을 개선하는 Transformer 기반 비용 집계 네트워크를 제안한다. 외관 유사도 모델링, 다중 수준 특징 집계, 스위핑 자기주의, 잔차 연결을 포함한다. 이는 더 빠른 추론과 변형 및 외관 변화에 대한 향상된 내성성으로 인해 의미적 대응 벤치마크에서 최고 성능을 기록한다.
We propose a novel cost aggregation network, called Cost Aggregation Transformers (CATs), to find dense correspondences between semantically similar images with additional challenges posed by large intra-class appearance and geometric variations. Cost aggregation is a highly important process in matching tasks, which the matching accuracy depends on the quality of its output. Compared to hand-crafted or CNN-based methods addressing the cost aggregation, in that either lacks robustness to severe deformations or inherit the limitation of CNNs that fail to discriminate incorrect matches due to limited receptive fields, CATs explore global consensus among initial correlation map with the help of some architectural designs that allow us to fully leverage self-attention mechanism. Specifically, we include appearance affinity modeling to aid the cost aggregation process in order to disambiguate the noisy initial correlation maps and propose multi-level aggregation to efficiently capture different semantics from hierarchical feature representations. We then combine with swapping self-attention technique and residual connections not only to enforce consistent matching but also to ease the learning process, which we find that these result in an apparent performance boost. We conduct experiments to demonstrate the effectiveness of the proposed model over the latest methods and provide extensive ablation studies. Project page is available at : https://sunghwanhong.github.io/CATs/.
연구 동기 및 목표
- 의미적 대응에서 큰 반류 외관 및 기하학적 변형을 다루는 데에 CNN 기반 비용 집계의 한계를 해결한다.
- 기존 CNN 기반 방법에서 제한된 수신장과 모호한 매칭을 해결할 수 없는 문제를 극복한다.
- Transformer의 전역적 맥락을 활용하여 모든 매칭 점수 간의 공감대를 통해 정확도를 향상시킨다.
- 외관 유사도와 다중 수준 특징 표현을 통합하여 노이즈가 많은 상관도 맵에서의 내성성과 모호성 제거를 향상시킨다.
- 수동으로 설계된 방법과 CNN 기반 방법보다 뛰어난 성능을 보이는 학습 가능한, 효율적이고 효과적인 비용 집계 모듈을 설계한다.
제안 방법
- 전체 상관도 맵에 대해 자기주의를 적용하는 Transformer 기반 비용 집계 모듈을 도입하여 매칭 점수 간의 전역 공감대를 캡처한다.
- 외관 임bedding을 상관도 맵에 연결하여 주의를 유도하고 노이즈가 많거나 모호한 매칭의 해소를 향상시킨다.
- 계층적 특징 표현에서 유도된 상관도 맵을 스택하여 다양한 의미 수준을 캡처하는 다중 수준 집계를 구현한다.
- 연속적으로 소스 및 타겟 차원을 뒤바꿔 스위핑 자기주의를 적용하여 双방향 일致성을 강화하고 일관되지 않은 예측을 줄인다.
- 주의 블록 주변에 잔차 연결을 통합하여 학습 안정성과 학습 역학을 향상시킨다.
- 학습 가능한 쿼리, 키, 밸류를 갖는 표준 다중 헤드 자기주의를 사용하고 전체 아키텍처를 엔드 투 엔드로 최적화한다.
실험 결과
연구 질문
- RQ1Transformer 기반 비용 집계 네트워크가 의미적 대응에서 큰 외관 및 기하학적 변형을 다루는 데에 CNN 기반 및 수동 설계 방법보다 뛰어난 성능을 보일 수 있는가?
- RQ2외관 유사도 모델링을 통합할 경우 노이즈가 많은 초기 상관도 맵의 모호성 제거에 어떤 영향을 미치는가?
- RQ3다중 수준 집계는 다양한 의미 수준에서 특징 표현과 매칭 정확도를 어느 정도 향상시키는가?
- RQ4병렬 처리와 비교해 병렬 처리보다 연속적인 상관도 맵 스위칭이 이중 일관성을 향상시키고 일관되지 않은 예측을 줄이는가?
- RQ5메모리, 추론 시간, 정확도 측면에서 이전 방법과 비교해 제안된 아키텍처는 효율성과 성능 측면에서 어떻게 비교되는가?
주요 결과
- CATs는 SPair-71k, LSPair-300K 및 기타 벤치마크에서 최고 성능을 기록하며, $α_{\mathrm{bbox}} = 0.1$ 조건에서 SPair-71k에서 PCK 42.4를 달성하여 이전 방법을 능가한다.
- 모델은 뛰어난 효율성을 보이며, 단일 RTX 2080 Ti GPU에서 7.4ms의 추론 시간을 기록하여 4D/6D 컨볼루션 및 최적화 운반 기반 방법보다 훨씬 빠르다.
- 제거 실험을 통해 외관 유사도, 다중 수준 집계, 스위핑 자기주의, 잔차 연결 각각이 성능 향상에 기여한다는 것이 확인되었다.
- 상관도 맵의 연속적 스위칭은 병렬 처리(40.8)보다 높은 PCK(42.4)를 기록하여 순차적 정제를 통한 더 나은 일관성 학습이 가능함을 시사한다.
- 자료 부족 상황에서도 내성성이 뛰어나 데이터 증강의 이점을 얻으며, 향후 자기지도 학습 확장 가능성을 시사한다.
- 강력한 성능에도 불구하고 CATs는 대응하지 않는 이미지에 대해서도 대응을 예측하는 경향이 있어, 향후 연구에서 신뢰도 인식 모듈이 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.