Skip to main content
QUICK REVIEW

[논문 리뷰] TORE: Token Reduction for Efficient Human Mesh Recovery with Transformer

Zhiyang Dou, Qingxuan Wu|arXiv (Cornell University)|2022. 11. 19.
Advanced Neural Network Applications인용 수 4
한 줄 요약

TORE는 뼈대 기하 구조 사전 지식과 학습 가능한 클러스터링을 활용하여 부적절한 2D 이미지 특징과 3D 메시 정점의 중복 토큰을 제거하는 토큰 감소 프레임워크를 제안한다. 계층적인 기하 구조 인식 쿼리와 비지도 특징 클러스터링을 통해 토큰을 감소시킴으로써, Human3.6M 및 3DPW 벤치마크에서 최상의 정확도를 달성하면서도 FLOPs를 최대 78% 감소시키고, 처리 속도를 2.5배 향상시켰다. 이는 효율성-정확도 트레이드오프 측면에서 뛰어난 성능을 보여준다.

ABSTRACT

In this paper, we introduce a set of simple yet effective TOken REduction (TORE) strategies for Transformer-based Human Mesh Recovery from monocular images. Current SOTA performance is achieved by Transformer-based structures. However, they suffer from high model complexity and computation cost caused by redundant tokens. We propose token reduction strategies based on two important aspects, i.e., the 3D geometry structure and 2D image feature, where we hierarchically recover the mesh geometry with priors from body structure and conduct token clustering to pass fewer but more discriminative image feature tokens to the Transformer. Our method massively reduces the number of tokens involved in high-complexity interactions in the Transformer. This leads to a significantly reduced computational cost while still achieving competitive or even higher accuracy in shape recovery. Extensive experiments across a wide range of benchmarks validate the superior effectiveness of the proposed method. We further demonstrate the generalizability of our method on hand mesh recovery. Visit our project page at https://frank-zy-dou.github.io/projects/Tore/index.html.

연구 동기 및 목표

  • 입력 특징과 메시 정점에서 발생하는 중복 토큰으로 인해 발생하는 Transformer 기반 인간 메시 복구(HMR)의 높은 계산 비용을 해결하기 위해.
  • 인간 신체 기하의 구조적 사전 지식과 구분 능력 있는 이미지 특징을 활용하여 정확도를 유지하면서 효율성을 향상시키기 위해.
  • 기하학적 충실도를 유지하면서 비정보성 토큰을 제거하는 경량이며 종단 간 훈련 가능한 토큰 감소 기법을 개발하기 위해.
  • 손상된 관찰 및 도전적인 시야 조건에서도 견고하고 수동 수단으로 손상된 손 메시 복구에 일반화할 수 있도록 하기 위해.
  • 단일 뷰 HMR에서 정확도와 추론 속도 사이의 파레토 최적 균형을 달성하기 위해.

제안 방법

  • 전체 메시 정점의 계층적 회귀를 위해 소량의 뼈대 수준의 신체 토큰을 사용하는 신경 메시 회귀기(NSR)를 도입하여, 정점 간 어텐션 복잡도를 감소시킨다.
  • 클러스터링 기반 선택을 통해 CNN 특징 패치를 클러스터링하는 학습 가능한 비지도 토큰 제거기(프루닝 기법)를 제안하여 유의미한 이미지 토큰만 유지한다.
  • 어텐션 행렬 분해를 활용하여 계층적 메시 복구를 구조화된 어텐션 메커니즘으로 해석하고, 뼈대 사전 지식을 활용해 특징 상호작용을 안내한다.
  • 추가 애너테이션 없이 단일 단계, 종단 간 훈련 방식을 적용하여 프루닝과 메시 회귀를 동시에 최적화한다.
  • 정확도와 효율성의 균형을 고려해 경험적으로 20%의 프루닝 비율을 선택하였으며, 다양한 벤치마크에서 검증하였다.
  • 토큰 감소 모듈을 FastMETRO 및 METRO 기반 아키텍처에 통합하여 즉각적인 효율성 향상을 가능하게 한다.

실험 결과

연구 질문

  • RQ12D 이미지 특징과 3D 메시 정점 양쪽에서 중복 토큰을 감소시켜 Transformer 기반 HMR의 계산 비용을 크게 낮출 수 있을까? 이로 인해 정확도가 떨어지지 않을까?
  • RQ2뼈대 관절 사전 지식을 사용해 어텐션 메커니즘에서 전체 메시 정점 쿼리 대신 활용할 경우, 기하 구조 인식 메시 복구에 얼마나 효과적인가?
  • RQ3비지도 클러스터링 기반 토큰 프루너는 의미 있는 이미지 특징을 식별하여 일반화 능력을 향상시키고 FLOPs를 줄일 수 있는가?
  • RQ4제안된 토큰 감소 전략은 부분적 가림 및 도전적인 단일 뷰 조건에서도 성능을 유지하거나 향상시키는가?
  • RQ5이 방법은 손 메시 복구와 같은 다른 메시 복구 작업으로 일반화될 수 있는가?

주요 결과

  • TORE는 Human3.6M 및 3DPW 벤치마크에서 기준 모델 대비 최대 78%의 FLOPs 감소를 이끌었으며, 정확도를 유지하거나 향상시켰다.
  • Human3.6M에서 TORE는 36.4 mm의 PAMPJPE를 기록했고, 249.2 FPS의 처리 속도를 확보하여 TCFormer 및 PPT보다 빠른 속도와 더 높은 정확도를 확보했다.
  • FastMETRO-Eb0에서 TORE는 1.6 GFLOP의 모델 크기로 870.4 FPS의 처리 속도를 기록하여, PPT보다 높은 처리 속도와 더 낮은 PAMPJPE를 확보했다.
  • 자기 어텐션 시각화 결과, 관절과 정점 간에 국소적이지 않은 강력한 상호작용이 학습되었으며, 이는 가림 및 부분 관찰 조건에서도 성능 향상을 이끌었다.
  • 20%의 프루닝 비율이 최적의 균형을 이끌었으며, PAMPJPE는 43.9 mm를 기록했다. 반면 높은 비율(예: 75%)은 FLOPs를 낮추기는 하지만 성능 저하를 초래했다.
  • 3DPW 및 Human3.6M에서의 정성적 결과는, 다양한 자세와 뷰 조건에서도 METRO, MeshGraphormer, FastMETRO보다 더 정확하고 안정적인 메시를 생성함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.