Skip to main content
QUICK REVIEW

[논문 리뷰] From Saliency to DINO: Saliency-guided Vision Transformer for Few-shot Keypoint Detection

Changsheng Lu, Hao Zhu|arXiv (Cornell University)|2023. 04. 06.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 마스크된 자기주의와 형태학적 학습자를 사용하여 전경 영역에 집중하고 수신장역할을 동적으로 적응시키는 색소니티 가이드드 비전 트랜스포머(SalViT)를 제안한다. 이는 소수 샘플 키포인트 검출을 향상시키는 데 기여하며, 심한 가림을 견딜 수 있도록 하며, DINO를 경량 색소니티 검출기로 활용하여 표준 모델보다 최대 10% 높은 PCK 성능을 달성한다.

ABSTRACT

Unlike current deep keypoint detectors that are trained to recognize limited number of body parts, few-shot keypoint detection (FSKD) attempts to localize any keypoints, including novel or base keypoints, depending on the reference samples. FSKD requires the semantically meaningful relations for keypoint similarity learning to overcome the ubiquitous noise and ambiguous local patterns. One rescue comes with vision transformer (ViT) as it captures long-range relations well. However, ViT may model irrelevant features outside of the region of interest due to the global attention matrix, thus degrading similarity learning between support and query features. In this paper, we present a novel saliency-guided vision transformer, dubbed SalViT, for few-shot keypoint detection. Our SalViT enjoys a uniquely designed masked self-attention and a morphology learner, where the former introduces saliency map as a soft mask to constrain the self-attention on foregrounds, while the latter leverages the so-called power normalization to adjust morphology of saliency map, realizing ``dynamically changing receptive field''. Moreover, as salinecy detectors add computations, we show that attentive masks of DINO transformer can replace saliency. On top of SalViT, we also investigate i) transductive FSKD that enhances keypoint representations with unlabelled data and ii) FSKD under occlusions. We show that our model performs well on five public datasets and achieves ~10% PCK higher than the normally trained model under severe occlusions.

연구 동기 및 목표

  • 소수 샘플 키포인트 검출(FSKD)에서 도메인 이동과 제한된 감독 하에 노이즈가 많고 모호한 局부 패턴 문제를 해결하기 위해.
  • 색소니티 전경 영역 내의 장거리 관계를 모델링하여 지원 및 쿼리 특징 간의 유사성 학습을 향상시키기 위해.
  • 외부 색소니티 검출기 대신 DINO의 주의 맵을 사용하여 특징을 주의적으로 추출함으로써 계산 오버헤드를 줄이기 위해.
  • 마스크링 및 정렬(MAA) 전략을 통해 키포인트 가림에 대한 강건성을 향상시켜 부분 감독 하에서도 일반화 성능을 향상시키기 위해.

제안 방법

  • 색소니티 맵을 소프트 마스크로 사용하여 자기주의 계산을 전경 패치에만 제한하는 마스크된 자기주의(M-SA) 모듈을 도입한다.
  • 색소니티 맵에 거듭제곱 정규화를 적용하여 키포인트 후보 주변의 관련 맥락을 더 잘 포착할 수 있도록 수신장역할을 동적으로 조정할 수 있는 형태학적 학습자(ML)를 제안한다.
  • 외부 색소니티 검출기의 대체로 DINO의 주의 맵을 사용하여 추론 비용을 감소시키면서도 성능을 유지한다.
  • 비표본 데이터를 사용하여 지원 키포인트 프로토타입을 풍부화하는 전이적 FSKD 변형을 설계하여, 저샘플링 환경에서 표현 품질을 향상시킨다.
  • 학습 중에 RGB, 색소니티, CNN 특징 마스킹과 함께 확률 맵 정렬을 포함하는 마스크링 및 정렬(MAA) 전략을 적용하여 가림에 대한 강건성을 향상시킨다.
  • 이미지 공간(SimMIM), 예측 공간(비가림 손실), 특징 공간(ℓ1, ℓ2, MMD)의 다중 정렬 전략을 적용하여 가림 상황에서의 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1색소니티 가이드드 어텐션은 관련 전경 영역에 자기주의 집중을 통해 배경 노이즈를 억제함으로써 소수 샘플 키포인트 검출을 향상시킬 수 있는가?
  • RQ2형태학적 학습자가 소수 샘플 키포인트 검출에서 특징 표현을 향상시키기 위해 수신장역할을 동적으로 적응시키는 데 얼마나 효과적인가?
  • RQ3DINO의 주의 맵은 성능 손실 없이 외부 색소니티 검출기의 경량 효과적 대체로 사용될 수 있는가?
  • RQ4제안된 마스크링 및 정렬(MAA) 전략은 소수 샘플 설정에서 키포인트 가림에 대한 강건성을 얼마나 향상시키는가?
  • RQ5비표본 데이터를 활용한 전이적 FSKD는 저샘플링 환경에서 키포인트 프로토타입 품질과 일반화 성능을 향상시키는가?

주요 결과

  • Animal Pose 데이터셋에서 100% 가림 조건 하에, 일반적으로 훈련된 모델 대비 SalViT 모델이 PCK에서 상대적으로 10% 향상된 성능(최대 약 10% 향상)을 기록한다.
  • Animal Pose 데이터셋에서 1-shot 전이적 FSKD 상황에서 제안된 M-SA 및 ML 구성 요소가 인덕티브 기반 모델 대비 조화 평균 점수에서 3.23%p의 절대 향상 성과를 기록한다.
  • DINO의 주의 맵을 색소니티 프록시로 사용함으로써 계산 비용을 감소시키면서도 성능 유지가 가능하며, 외부 색소니티 모델 사용 대비 정확도 저하가 최소한이다.
  • MAA 전략의 확률 맵 정렬 전략은 다른 정렬 방법보다 뛰어나며, 마스킹 전용 전략 대비 최대 2% 향상된 PCK 성능과 표준 모델 대비 10% 향상된 성능(100% 가림 조건 하)을 기록한다.
  • 절단 분석 결과, 학습 중 RGB, 색소니티, CNN 특징 마스킹이 강건성을 향상시키며, 전체 MAA 전략(마스킹 + 확률 맵 정렬)이 심한 가림 조건 하에서 가장 높은 성능을 기록한다.
  • 비표본 데이터를 활용한 전이적 FSKD와 프로토타입 정밀화는 Animal Pose에서 4.97%, AwA에서 4.91%의 성능 향상을 이끌어내어 저샘플링 환경에서의 데이터 풍부화의 유용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.