Skip to main content
QUICK REVIEW

[논문 리뷰] Not All Tokens Are Equal: Human-centric Visual Analysis via Token Clustering Transformer

Wang Zeng, Sheng Jin|arXiv (Cornell University)|2022. 04. 19.
Human Pose and Action Recognition인용 수 9
한 줄 요약

이 논문은 인간 중심 시각 작업에서 더 높은 해상도의 세부 정보를 유지하기 위해 점진적인 클러스터링을 통해 다양한 형태와 크기의 토큰을 동적으로 생성하는 비전 트랜스포머인 Token Clustering Transformer (TCFormer)를 제안한다. TCFormer는 새로운 Clustering Token Merge (CTM) 블록과 Multi-stage Token Aggregation (MTA) 헤드를 통해 세부 정보를 유지함으로써, 전체 신체 자세 추정 및 3D 메시 재구성과 같은 인간 중심 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Vision transformers have achieved great successes in many computer vision tasks. Most methods generate vision tokens by splitting an image into a regular and fixed grid and treating each cell as a token. However, not all regions are equally important in human-centric vision tasks, e.g., the human body needs a fine representation with many tokens, while the image background can be modeled by a few tokens. To address this problem, we propose a novel Vision Transformer, called Token Clustering Transformer (TCFormer), which merges tokens by progressive clustering, where the tokens can be merged from different locations with flexible shapes and sizes. The tokens in TCFormer can not only focus on important areas but also adjust the token shapes to fit the semantic concept and adopt a fine resolution for regions containing critical details, which is beneficial to capturing detailed information. Extensive experiments show that TCFormer consistently outperforms its counterparts on different challenging human-centric tasks and datasets, including whole-body pose estimation on COCO-WholeBody and 3D human mesh reconstruction on 3DPW. Code is available at https://github.com/zengwang430521/TCFormer.git

연구 동기 및 목표

  • 고정 격자 비전 트랜스포머가 의미적 중요도에 관계없이 모든 이미지 영역을 동일하게 취급하는 한계를 해결하기 위해.
  • 얼굴과 손과 같은 중요한 인간 신체 영역에 더 많은 토큰을 할당하고 배경에는 토큰을 줄이기 위해.
  • 의미적 콘텐츠와 작업 요구사항에 따라 토큰의 형태, 크기, 위치를 동적으로 조정할 수 있는 동적 토큰 생성 메커니즘을 개발하기 위해.
  • 다단계 특징 집합 과정에서 공간 정밀도를 잃지 않으면서도 고해상도 세부 정보를 유지하기 위해.
  • COCO-WholeBody 및 3DPW와 같은 인간 중심 시각 벤치마크에서 뛰어난 성능을 달성하기 위해.

제안 방법

  • TCFormer는 첫 번째 단계에서 각 픽셀을 비전 토큰으로 초기화하며, 각 토큰은 단일 픽셀 영역을 나타낸다.
  • 특징 기반으로 유사한 토큰을 그룹화하기 위해 k-최근접 이웃 기반의 밀도 피크 클러스터링(KNN-DPC) 알고리즘을 적용한다.
  • 동일한 클러스터에 속한 토큰들은 특징 평균화를 통해 병합되며, 병합된 토큰의 영역은 입력 영역의 합집합이 된다.
  • 병합된 토큰들은 트랜스포머 블록을 통해 처리되어 비직사각형이며 비정규적인 형태의 영역 간 장거리 어텐션을 가능하게 한다.
  • 다단계 토큰 집합(MTA) 헤드는 후속 단계의 토큰을 점진적으로 업샘플링하고 모든 단계의 특징을 집계하여 픽셀 정렬 특징 맵을 재구성한다.
  • MTA 헤드는 각 픽셀이 유일한 토큰에 대응되도록 하여 고정 격자 변환에서 발생하는 겹치는 토큰으로 인한 특징 손실을 방지한다.

실험 결과

연구 질문

  • RQ1고정 격자 토크나이제이션과 비교해 볼 때, 동적이고 비균일한 토큰 생성이 인간 중심 시각 작업의 성능 향상에 기여하는가?
  • RQ2비전 토큰의 점진적 클러스터링이 얼굴과 손과 같은 중요한 신체 부위의 세밀한 세부 정보 유지에 어떤 영향을 미치는가?
  • RQ3제안된 Clustering Token Merge (CTM) 블록이 표준 평균 풀링 또는 고정 격자 방법에 비해 특징 표현을 얼마나 향상시키는가?
  • RQ4다단계 특징 융합 과정에서 Multi-stage Token Aggregation (MTA) 헤드가 공간 세부 정보를 효과적으로 유지하는가?
  • RQ5TCFormer가 얼굴 키포인트 검출과 손 키포인트 검출과 같은 작업별 우선순위에 맞게 토큰 분포를 적응적으로 조정할 수 있는가?

주요 결과

  • COCO-WholeBody에서 TCFormer는 전체 신체 자세 추정 작업에서 58.7 AP를 기록하여 베이스라인 대비 2.1 AP 향상.
  • 3DPW에서 TCFormer는 3D 인간 메시 재구성 작업에서 평균 MPJPE 28.6을 달성하여 베이스라인 대비 1.8 향상.
  • CTM 블록은 세밀한 영역에서의 성능 저하를 감소시킨다: 굵은 토큰을 사용할 경우 손 AP는 오직 5.6% 감소하고 얼굴 AP는 13.6% 감소하여 강력한 세부 정보 유지 능력을 보여준다.
  • MTA 헤드를 디컨볼루션 헤드로 대체하면 발 관절 키포인트 검출에서 AP가 4.0% 감소하여 MTA의 세부 정보 유지 능력이 입증된다.
  • 정성적 분석 결과, TCFormer는 얼굴과 손과 같은 고해상도 세부 정보 영역에 세밀한 토큰을 할당하며, 얼굴 키포인트 검출과 손 키포인트 검출을 위한 모델 학습에서 볼 수 있듯이 작업에 적응하는 토큰 분포를 보인다.
  • 이 방법은 비전 트랜스포머에서 동적 비전 토큰 생성을 위한 클러스터링을 처음으로 사용하며, 의미 인식 기반의 다양한 형태와 크기의 토큰을 유연하게 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.