Skip to main content
QUICK REVIEW

[논문 리뷰] CoKe: Localized Contrastive Learning for Robust Keypoint Detection

Yutong Bai, Angtian Wang|arXiv (Cornell University)|2020. 09. 29.
Human Pose and Action Recognition참고 문헌 51인용 수 8
한 줄 요약

CoKe는 키포인트 벡터를 별도로 모델링하기 위해 키포인트 백업, 잡음 백업, 누적 이동 평균 업데이트를 사용하는 대비 학습 프레임워크를 도입하여, PASCAL3D+, MPII, ObjectNet3D와 같은 다양한 데이터셋에서 부분적 가림 및 예측 불가능한 자세에 대해 뛰어난 성능과 높은 강건성을 달성한다. 이는 상태의 기술(SOTA) 수준이다.

ABSTRACT

In this paper, we introduce a contrastive learning framework for keypoint detection (CoKe). Keypoint detection differs from other visual tasks where contrastive learning has been applied because the input is a set of images in which multiple keypoints are annotated. This requires the contrastive learning to be extended such that the keypoints are represented and detected independently, which enables the contrastive loss to make the keypoint features different from each other and from the background. Our approach has two benefits: It enables us to exploit contrastive learning for keypoint detection, and by detecting each keypoint independently the detection becomes more robust to occlusion compared to holistic methods, such as stacked hourglass networks, which attempt to detect all keypoints jointly. Our CoKe framework introduces several technical innovations. In particular, we introduce: (i) A clutter bank to represent non-keypoint features; (ii) a keypoint bank that stores prototypical representations of keypoints to approximate the contrastive loss between keypoints; and (iii) a cumulative moving average update to learn the keypoint prototypes while training the feature extractor. Our experiments on a range of diverse datasets (PASCAL3D+, MPII, ObjectNet3D) show that our approach works as well, or better than, alternative methods for keypoint detection, even for human keypoints, for which the literature is vast. Moreover, we observe that CoKe is exceptionally robust to partial occlusion and previously unseen object poses.

연구 동기 및 목표

  • 이미지당 여러 개의 레이블링된 키포인트가 존재하는 점을 고려해, 대비 학습을 키포인트 검출에 적용하는 데 도전한다.
  • 모든 키포인트 특징 간의 쌍별 대비 손실 계산이 계산적으로 불가능한 점을 해결하기 위해, 원형 표현을 도입한다.
  • 배경 잡음 특징을 명시적으로 모델링하고 키포인트 특징와 구분함으로써, 가림 및 예측 불가능한 물체 자세에 대한 강건성을 향상시킨다.
  • 새로운 메모리 백업과 적응형 특징 업데이트 메커니즘을 통해 효율적이고 확장 가능한 키포인트 검출을 위한 대비 학습을 가능하게 한다.

제안 방법

  • 각 키포인트 유형의 원형 표현을 저장하는 키포인트 백업을 도입하여, 키포인트 내부 특징 클러스터링을 효율적으로 계산할 수 있도록 한다.
  • 공간적으로 가까운 배경 특징을 저장함으로써 비키포인트 특징을 모델링하는 잡음 백업을 개발하여, 오분류를 줄인다.
  • 학습 중에 키포인트 원형 표현을 동적으로 유지하기 위해 누적 이동 평균 업데이트를 사용하여 안정적이고 적응형 특징 학습을 보장한다.
  • 잡음 특징과 키포인트 원형 표현 간의 거리를 명시적으로 정규화하기 위해 잡음 샘플링 손실을 구현하여 특징의 구분 능력을 향상시킨다.
  • 동일한 키포인트 클러스터 내 특징는 서로 가까이, 다른 키포인트 및 잡음 특징는 서로 멀리 떨어지도록 하는 방식으로 키포인트 검출을 대비 학습 문제로 재구성한다.
  • 특징 품질 향상과 검출 정확도 향상을 위해, 대비 목표함수를 표준 분류 또는 회귀 손실과 결합하여 학습한다.

실험 결과

연구 질문

  • RQ1이미지당 여러 개의 서로 다른 키포인트가 존재하는 점을 고려할 때, 대비 학습이 키포인트 검출에 효과적으로 적용될 수 있는가?
  • RQ2모든 키포인트 특징 간의 쌍별 대비 손실 계산 비용을 성능 저하 없이 줄일 수 있는가?
  • RQ3배경 잡음을 명시적으로 모델링하는 것이 키포인트 검출의 가림에 대한 강건성에 어떤 영향을 미치는가?
  • RQ4누적 이동 평균을 통한 동적 원형 업데이트 방식이 키포인트 특징 학습의 안정성과 정확도에 어떤 영향을 미치는가?
  • RQ5전체 검출 방법 대비 CoKe는 부분적 가림 및 예측 불가능한 자세에 대해 얼마나 높은 강건성을 확보하는가?

주요 결과

  • CoKe는 PASCAL3D+, MPII, ObjectNet3D에서 SOTA 성능을 달성하였으며, 특히 도전적인 케이스에서 스택드 아워글라스 네트워크와 MSS-Net을 능가한다.
  • Res-UNet 백본을 사용한 PASCAL3D+에서, CoKe는 수준 0 가림 조건에서 95.5%의 정확도를 기록했으며, 잡음 백업이 없는 기준 모델(94.2%)과 평균 근사 방법(88.7%)보다 뚜렷하게 뛰어나다.
  • 1024개의 그룹을 가진 잡음 백업은 수준 0 가림 조건에서 95.5%의 정확도를 달성하여, 더 큰 백업이 성능 향상에 기여하며 특히 저가림 조건에서 두드러진다.
  • 잡음 샘플링 손실은 핵심적이다: 이를 비활성화하면 수준 0 가림 조건에서 정확도가 95.5%에서 94.2%로 감소하여, 특징의 구분 능력을 향상시키는 데 기여함을 보여준다.
  • 누적 이동 평균 업데이트 방식은 주기적 평균화 방식보다 우수하다(수준 0 가림 조건에서 94.2% 대비 88.7%): 안정적인 키포인트 원형 표현 유지 능력이 입증된다.
  • CoKe는 부분적 가림 및 예측 불가능한 자세에 대해 뛰어난 강건성을 보이며, 모든 가림 수준에서 기준 방법보다 성능 저하가 훨씬 느리게 발생한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.