[논문 리뷰] ViTPose++: Vision Transformer for Generic Body Pose Estimation
이 논문은 일반적인 바디 포즈 추정을 위한 단순하면서도 강력한 비전 트랜스포머 기반 모델인 ViTPose와 ViTPose++을 제안한다. 단순한 비계층적 비전 트랜스포머 백본과 경량 디코더를 활용하여 ViTPose는 MS COCO 및 여러 벤치마크에서 최신 기준 성능을 달성한다. ViTPose++는 지식 분해를 통해 다양한 신체 유형 간 다중 작업 학습을 가능하게 하여 속도를 희생시키지 않은 채 새로운 기록을 수립한다.
In this paper, we show the surprisingly good properties of plain vision transformers for body pose estimation from various aspects, namely simplicity in model structure, scalability in model size, flexibility in training paradigm, and transferability of knowledge between models, through a simple baseline model dubbed ViTPose. Specifically, ViTPose employs the plain and non-hierarchical vision transformer as an encoder to encode features and a lightweight decoder to decode body keypoints in either a top-down or a bottom-up manner. It can be scaled up from about 20M to 1B parameters by taking advantage of the scalable model capacity and high parallelism of the vision transformer, setting a new Pareto front for throughput and performance. Besides, ViTPose is very flexible regarding the attention type, input resolution, and pre-training and fine-tuning strategy. Based on the flexibility, a novel ViTPose+ model is proposed to deal with heterogeneous body keypoint categories in different types of body pose estimation tasks via knowledge factorization, i.e., adopting task-agnostic and task-specific feed-forward networks in the transformer. We also empirically demonstrate that the knowledge of large ViTPose models can be easily transferred to small ones via a simple knowledge token. Experimental results show that our ViTPose model outperforms representative methods on the challenging MS COCO Human Keypoint Detection benchmark at both top-down and bottom-up settings. Furthermore, our ViTPose+ model achieves state-of-the-art performance simultaneously on a series of body pose estimation tasks, including MS COCO, AI Challenger, OCHuman, MPII for human keypoint detection, COCO-Wholebody for whole-body keypoint detection, as well as AP-10K and APT-36K for animal keypoint detection, without sacrificing inference speed.
연구 동기 및 목표
- 특수 작업용 아키텍처 수정 없이도 단순한 비전 트랜스포머가 일반적인 바디 포즈 추정에 얼마나 잠재력을 지닐 수 있는지 조사하기 위해.
- 상향식 및 하향식 포즈 추정 모두에 적합한 확장성 있고 유연하며 이식 가능한 기준 모델을 개발하기 위해.
- 통합된 트랜스포머 아키텍처 내에서 지식 분해를 통해 이질적인 신체 관절점 카테고리(예: 인간, 동물) 간의 다중 작업 학습을 가능하게 하기 위해.
- 간단한 지식 토큰을 사용하여 대규모 모델에서 소규모 모델로 지식을 전달하는 데서의 효과성을 입증하기 위해.
- 모델 용량을 20M에서 1B 파rameter로 확장함으로써 포즈 추정에서 처리량과 정확도 사이의 새로운 파레토 프론트를 수립하기 위해.
제안 방법
- ViTPose는 상향식 또는 하향식 포즈 추정에서 히트맵 회귀를 위해 경량 디코더(두 개의 디컨볼루션 레이어와 예측 헤드 포함)와 함께 단순한 비계층적 비전 트랜스포머를 인코더로 사용한다.
- 비전 트랜스포머 백본은 강력한 특징 초기화를 제공하기 위해 마스크된 이미지 모델링(MAE 등)을 사용해 사전 훈련한다.
- ViTPose++는 트랜스포머 블록 내부에 작업별 및 작업에 관계없이 일반적인 피드포워드 네트워크(FFN)를 도입하여 다양한 신체 관절점 검출 작업 간 지식을 분해한다.
- ViTPose++의 지식 분해 기법은 믹스처 오브 익스퍼트(MoE)에서 영감을 얻었으며, 이는 다양한 신체 유형에 대해 공통 및 특수 표현을 학습할 수 있도록 한다.
- 대규모 ViTPose 모델에서 소규모 모델로 지식을 전달하기 위해 지식 토큰을 사용한다. 이는 효율적인 지식 전달을 가능하게 한다.
- 모델은 입력 해상도, 어텐션 유형, 사전 훈련/미세 조정 전략의 유연성 지원으로 다양한 데이터셋 간 적응성을 향상시킨다.
실험 결과
연구 질문
- RQ1특수 작업용 아키텍처 설계 없이도 단순한 비전 트랜스포머가 바디 포즈 추정에서 최신 기준 성능을 달성할 수 있는가?
- RQ2비전 트랜스포머의 확장성은 포즈 추정에서 모델 크기, 처리량, 정확도 간의 상호 상충 관계에 어떤 영향을 미치는가?
- RQ3지식 분해를 통해 통합된 트랜스포머 기반 모델이 이질적인 신체 관절점 카테고리(예: 인간, 동물)를 효과적으로 처리할 수 있는가?
- RQ4간단한 지식 토큰을 사용하여 대규모 ViTPose 모델의 지식을 소규모 모델로 얼마나 효과적으로 전달할 수 있는가?
- RQ5ViTPose의 어텐션 메커니즘과 특징 표현은 가림되거나 극단적인 자세 상황에서 어떻게 적응하는가?
주요 결과
- 10억 파rameter를 가진 ViTPose-G는 앙상블 없이도 MS COCO 테스트-디브 세트에서 80.9 AP의 새로운 최신 기준 정확도를 달성한다.
- ViTPose++는 MS COCO, AI Challenger, OCHuman, MPII, COCO-Wholebody, AP-10K, APT-36K 등 여러 벤치마크에서 최신 기준 성능을 기록하며, 추론 속도를 손상시키지 않는다.
- 모델은 심한 가림이 있는 이미지에서도 높은 성능을 유지한다. ViTPose++-B는 보이는 신체 부위를 기반으로 가려진 관절점 위치를 정확히 추론한다.
- 시각화 결과는 목표 관절점이 마스킹된 상태에서도 ViTPose++가 관절점 위치에서 일관된 어텐션 패턴을 유지함을 보여주며, 강력한 상관관계 모델링 능력을 시사한다.
- 코사인 유사도 분석 결과, 더 깊은 레이어에서 작업별 FFN 가중치는 작업 간(예: 인간 대 비슷한 동물) 더 뚜렷하게 구분됨을 확인하여, 더 깊은 레이어가 더 작업에 특화되어 있음을 시사한다.
- 스키와 같은 극단적인 자세에서의 실패 케이스는 백본을 확장하고 확장된 데이터셋으로 훈련함으로써 완화되며, 이는 접근법의 확장성과 유연성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.