Skip to main content
QUICK REVIEW

[논문 리뷰] HAP: Structure-Aware Masked Image Modeling for Human-Centric Perception

Junkun Yuan, Xinyu Zhang|arXiv (Cornell University)|2023. 10. 31.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

HAP는 인간 중심의 인식을 위해 구조 인식 마스크 이미지 모델링 프레임워크를 도입하며, 인간 부위 사전 지식을 활용해 마스크 샘플링을 유도하고, 구조 불변 정렬 손실을 통해 구조적 일관성을 강제한다. 일반적인 비전 트랜스포머를 사용하여 11개의 인간 중심 벤치마크에서 최신 기술 성능을 달성하였으며, 사람 재식별에 대해 MSMT17에서 78.1% mAP, 보행자 특성 인식에 대해 PA-100K에서 86.54% mA를 기록하였다.

ABSTRACT

Model pre-training is essential in human-centric perception. In this paper, we first introduce masked image modeling (MIM) as a pre-training approach for this task. Upon revisiting the MIM training strategy, we reveal that human structure priors offer significant potential. Motivated by this insight, we further incorporate an intuitive human structure prior - human parts - into pre-training. Specifically, we employ this prior to guide the mask sampling process. Image patches, corresponding to human part regions, have high priority to be masked out. This encourages the model to concentrate more on body structure information during pre-training, yielding substantial benefits across a range of human-centric perception tasks. To further capture human characteristics, we propose a structure-invariant alignment loss that enforces different masked views, guided by the human part prior, to be closely aligned for the same image. We term the entire method as HAP. HAP simply uses a plain ViT as the encoder yet establishes new state-of-the-art performance on 11 human-centric benchmarks, and on-par result on one dataset. For example, HAP achieves 78.1% mAP on MSMT17 for person re-identification, 86.54% mA on PA-100K for pedestrian attribute recognition, 78.2% AP on MS COCO for 2D pose estimation, and 56.0 PA-MPJPE on 3DPW for 3D pose and shape estimation.

연구 동기 및 목표

  • 마스크 이미지 모델링(MIM)이 인간 중심 인식 작업을 위한 사전 훈련 프레임워크로 효과적으로 적용될 수 있는지 조사한다.
  • 표준 MIM이 인간 중심 환경에서 가지는 한계를 규명하고, 인간 구조 사전 지식이 성능 향상에 기여하는 방식을 이해한다.
  • 간단하면서도 효과적인 방법을 개발하여 인간 부위 사전 지식을 마스크 샘플링 과정에 통합함으로써 사전 훈련 중 구조적 이해를 향상시킨다.
  • 동일한 이미지의 서로 다른 마스크 처리된 시각 간 일관성을 강제함으로써 특징의 구분 능력을 향상시키는 구조 불변 정렬 손실을 설계한다.
  • 단일 통합 데이터셋과 일반적인 ViT 아키텍처를 사용하여 다양한 인간 중심 시각 작업에 대해 유연하고 확장 가능하며 효율적인 사전 훈련 프레임워크를 수립한다.

제안 방법

  • 사전 훈련된 관절 검출기(예: off-the-shelf keypoint detectors)를 통해 추출한 인간 부위 사전 지식을 활용해 마스크 샘플링 과정을 유도하며, 인간 부위 영역 내의 이미지 패치를 마스킹 우선순위로 설정한다.
  • 표준 마스크 이미지 모델링 목적함수를 적용하여, 가시적 맥락을 이용해 마스킹된 패치를 재구성하며, 재구성 과정에서 의미 있는 인간 신체 부위에 집중한다.
  • 동일한 이미지의 두 개의 무작위 마스크 처리된 시각 간 일관성을 강제하는 구조 불변 정렬 손실을 제안하며, 이는 인간 부위 사전 지식에 의해 유도된 마스크 샘플링을 기반으로 한다.
  • 일반적인 비전 트랜스포머(ViT)를 인코더로 사용하여, 아키텍처의 복잡성 없이도 후속 작업으로의 전이가 용이하다.
  • 이미지와 관절 모달리티를 단일 사전 훈련 데이터셋(LUPerson) 내에서 통합하여, 추론 시 다중 모odal 데이터가 필요 없도록 한다.
  • 이중 단계 훈련 전략을 적용한다: LUPerson에서 MIM과 인간 부위 유도 마스크 샘플링을 사용한 사전 훈련 후, 표준 지도 학습을 통해 후속 작업에서 미세 조정한다.

실험 결과

연구 질문

  • RQ1마스크 이미지 모델링(MIM)은 인간 중심 인식 작업에 효과적으로 적용될 수 있으며, 만약 그렇다면 초반 성능가 낮은 성능을 극복하기 위해 어떤 수정이 필요한가?
  • RQ2특히 인간 부위 영역과 같은 인간 구조 사전 지식은 인간 중심 사전 훈련에서 MIM의 효과성을 어떻게 향상시키는가?
  • RQ3마스크 샘플링 전략, 스케일링 비율, 중간 마스크 비율이 인간 중심 환경에서 MIM 성능에 미치는 영향은 무엇인가?
  • RQ4구조 불변 정렬 손실은 동일한 이미지의 서로 다른 마스크 처리된 시각 간 일관성을 강제함으로써 특징의 구분 능력을 향상시킬 수 있는가?
  • RQ5인간 부위 유도 기반의 단순한 ViT 아키텍처는 다양한 인간 중심 벤치마크에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • HAP는 사람 재식별에 대해 MSMT17에서 78.1% mAP를 기록하여 이 벤치마크에서 새로운 최고 성능을 수립하였다.
  • 보행자 특성 인식에 대해 PA-100K에서 HAP는 86.54% 평균 정확도를 달성하여 이전 방법들을 능가하였다.
  • MS COCO에서 2D 인간 자세 추정에 대해 HAP는 78.2% AP를 기록하여 관절 기반 작업으로의 강력한 일반화 능력을 보였다.
  • 3DPW에서 3D 자세 및 형태 추정에 대해 HAP는 56.0 PA-MPJPE를 기록하여 3D 인간 신체 모델링 분야에서 뛰어난 성능을 보였다.
  • 텍스트 기반 이미지 사람 재식별에 대해 CUHK-PEDES에서 HAP는 68.05% Rank-1 정확도를 기록하여 경쟁력 있는 성능을 달성하였다.
  • 단지 100 에포크의 사전 훈련만으로도 만족스러운 성능를 기록하여 HAP의 효율성과 낮은 훈련 비용을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.