Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-supervised Keypoint Localization

Olga Moskvyak, Frédéric Maire|arXiv (Cornell University)|2021. 01. 20.
Human Pose and Action Recognition참고 문헌 34인용 수 5
한 줄 요약

이 논문은 소량의 레이블된 이미지와 대량의 레이블되지 않은 이미지를 사용하여 키포인트 히트맵과 자세 불변성 힘의 키포인트 표현을 함께 학습하는 준감독 키포인트 위치 지정 방법을 제안한다. 히트맵에 대해 변환 동치성, 표현에 대해 변환 불변성, 다양한 시각 간의 의미 일관성을 강제함으로써, 이 방법은 키포인트 검출 정확도를 크게 향상시킨다. ATRW와 LSP와 같은 도전적인 데이터셋에서 레이블된 데이터의 10%만으로도 완전히 감독된 모델과 비교할 만한 성능을 달성한다.

ABSTRACT

Knowledge about the locations of keypoints of an object in an image can assist in fine-grained classification and identification tasks, particularly for the case of objects that exhibit large variations in poses that greatly influence their visual appearance, such as wild animals. However, supervised training of a keypoint detection network requires annotating a large image dataset for each animal species, which is a labor-intensive task. To reduce the need for labeled data, we propose to learn simultaneously keypoint heatmaps and pose invariant keypoint representations in a semi-supervised manner using a small set of labeled images along with a larger set of unlabeled images. Keypoint representations are learnt with a semantic keypoint consistency constraint that forces the keypoint detection network to learn similar features for the same keypoint across the dataset. Pose invariance is achieved by making keypoint representations for the image and its augmented copies closer together in feature space. Our semi-supervised approach significantly outperforms previous methods on several benchmarks for human and animal body landmark localization.

연구 동기 및 목표

  • 높은 자세 변동성이 있는 야생 동물에 대해 레이블된 데이터가 제한된 키포인트 위치 지정 문제를 해결한다.
  • 전문가 레이블링이 비용이 많이 들고 흔하지 않은 실세계 환경에서 키포인트 검출의 노동 집약적인 레이블링 부담을 줄인다.
  • 레이블된 데이터와 레이블되지 않은 데이터를 효과적으로 활용하여 키포인트 검출 성능을 향상시키는 방법을 개발한다.
  • 자세 불변성 키포인트 표현을 학습함으로써 자세 변화에 대한 강건성을 확보한다.
  • 인간과 동물의 신체 기준점 검출을 포함한 다양한 종과 도메인 간의 이식 가능성 확보.

제안 방법

  • 감독 및 비지도 손실을 사용하여 키포인트 검출 네트워크를 동시에 학습시켜 히트맵과 의미적 키포인트 표현을 예측한다.
  • 데이터 증강에 대해 히트맵이 일관성을 유지하도록 변환 동치성 손실(TE)을 적용한다.
  • 이미지와 그 증강된 버전의 키포인트 표현을 특징 공간에서 정렬함으로써 변환 불변성 손실(TI)을 강제한다.
  • 다른 이미지 간에 동일한 키포인트에 대해 유사한 특징을 유도하는 의미 일관성 손실(SC)을 도입한다. 이는 자세에 관계없이 적용된다.
  • 비지도 손실에서 진짜 히트맵을 사용하여 학습 중 안정적인 감독 신호를 제공한다.
  • 감독 히트맵 손실과 세 가지 비지도 제약 조건을 조합하여 최적화하며, 학습 가능한 가중치 계수를 사용한다.

실험 결과

연구 질문

  • RQ1준감독 학습이 키포인트 위치 지정 작업에서 레이블된 키포인트 애너테이션의 필요성을 크게 줄일 수 있는가?
  • RQ2변환 동치성과 불변성 제약 조건이 높은 자세 변동성 하에서 키포인트 검출을 어떻게 향상시키는가?
  • RQ3이미지 간의 의미 일관성이 동일한 키포인트에 대한 특징 학습에 얼마나 기여하는가?
  • RQ4비지도 손실에 진짜 히트맵을 포함시키는 것이 모델 성능에 어떤 영향을 미치는가?
  • RQ5레이블되지 않은 데이터의 양을 변화시켰을 때 준감독 키포인트 위치 지정 모델의 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • ATRW 호랑이 데이터셋에서 레이블된 데이터의 10%만으로도 완전히 감독된 모델과 비교할 만한 성능을 달성한다.
  • LSP 인간 자세 데이터셋에서 레이블된 데이터의 50%만으로도 거의 감독된 성능에 도달한다.
  • 의미 일관성 손실(SC)이 가장 영향력 있는 성분으로, 5% 레이블된 데이터에서 제거할 경우 성능이 66%에서 46%로 떨어진다.
  • 다양한 인간 및 동물 키포인트 위치 지정 벤치마크에서 이전의 감독 및 비지도 접근법을 능가한다.
  • 제거 실험 결과, TE, TI, SC 손실의 조합이 개별 손실보다 더 우수한 성능을 낸다.
  • 손실 가중치의 초모수 변화에 대해 모델이 강건하며, 최적 성능은 λ₂=0.5, λ₃=10², λ₄=10²에서 달성된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.