Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition from Egocentric RGB Videos

Yilin Wen, Hao Pan|arXiv (Cornell University)|2022. 09. 20.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 3D 손 자세 추정과 행동 인식을 동시에 수행하기 위해 단기적 시간적 특징을 활용한 자세 추정과 장기적 특징을 활용한 행동 인식을 통합하는 계층적 시계열 트랜스포머 네트워크를 제안한다. 이 프레임워크는 서로 다른 수신장이 있는 두 개의 연결된 트랜스포머 인코더를 사용하여 FPHA 및 H2O 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Understanding dynamic hand motions and actions from egocentric RGB videos is a fundamental yet challenging task due to self-occlusion and ambiguity. To address occlusion and ambiguity, we develop a transformer-based framework to exploit temporal information for robust estimation. Noticing the different temporal granularity of and the semantic correlation between hand pose estimation and action recognition, we build a network hierarchy with two cascaded transformer encoders, where the first one exploits the short-term temporal cue for hand pose estimation, and the latter aggregates per-frame pose and object information over a longer time span to recognize the action. Our approach achieves competitive results on two first-person hand action benchmarks, namely FPHA and H2O. Extensive ablation studies verify our design choices.

연구 동기 및 목표

  • 에고세트릭 RGB 영상에서 손의 자가 차폐와 행동의 모호함에 기인한 손 동작 이해 과제를 해결한다.
  • 프레임 간 단기적 시간적 일관성을 활용하여 3D 손 자세 추정의 강건성을 향상시킨다.
  • 각 프레임의 예측에서 장기적 시간적 맥락을 통합하여 복잡한 손 동작(예: '우유 따르기', '우유 놓기')을 인식한다.
  • 손 동작과 물체 조작 간의 의미적 상관관계를 계층적, 연결된 트랜스포머 아키텍처로 모델링한다.
  • 반복적 보정이나 수작업으로 만든 특징 없이도 자세 추정과 행동 인식을 동시에 최적화할 수 있는 엔드 투 엔드 학습 가능한 프레임워크를 개발한다.

제안 방법

  • 단기 자세 인코더(창크 크기 t=16)와 장기 행동 인코더(창크 크기 T=128)로 구성된 이중 분기 계층적 트랜스포머 아키텍처를 설계한다.
  • 각 프레임의 이미지 특징을 추출하기 위해 비전 트랜스포머 백본을 사용하며, 이를 자세 및 행동 트랜스포머 블록에 입력한다.
  • 자세 블록은 학습 가능한 쿼리 메커니즘을 사용하여 각 프레임의 3D 손 관절 좌표와 물체 카테고리 레이블을 출력한다.
  • 행동 블록은 다중 헤드 자기어텐션을 활용하여 더 긴 시퀀스 동안 각 프레임의 자세 및 물체 예측을 통합하며, 학습 가능한 클래스 토큰을 사용한다.
  • 자세 블록과 행동 블록을 연결하여, 행동 블록의 입력으로 자세 블록의 각 프레임의 자세, 물체 레이블, 이미지 특징을 포함한다.
  • 3D 키포인트 회귀와 행동 분류의 교차 엔트로피를 조합한 공동 손실을 사용하여 전체 네트워크를 엔드 투 엔드로 학습시킨다.

실험 결과

연구 질문

  • RQ1다양한 시간 해상도에서 시간적 맥락을 모델링하면 에고세트릭 영상에서 3D 손 자세 추정 및 행동 인식 성능이 향상되는가?
  • RQ2연결된 트랜스포머 아키텍처의 계층적 설계가 병렬 또는 단일 브랜치 아키텍처에 비해 통합된 자세 및 행동 학습에서 어떤가?
  • RQ3손 동작과 물체 조작 간의 의미적 상관관계는 행동 인식 정확도에 얼마나 기여하는가?
  • RQ4장거리 시간적 모델링을 사용할 경우, 개별 프레임에서 모호한 행동의 인식 성능이 향상되는가?
  • RQ5이러한 작업에서 단순한 엔드 투 엔드 피드포워드 트랜스포머 아키텍처가 반복적 또는 다단계 방법을 능가할 수 있는가?

주요 결과

  • 제안된 계층적 시계열 트랜스포머는 FPHA 데이터셋에서 94.09%의 행동 인식 정확도와 H2O 데이터셋에서 86.36%를 기록하여 새로운 최신 기술 수준의 결과를 달성했다.
  • 제거 실험 결과, 병렬 아키텍처 대비 연결 설계가 FPHA에서 0.87% 향상되고 H2O에서 6.19% 향상되어 계층적 모델링의 유용성을 확인했다.
  • 행동 블록의 입력으로 각 프레임의 자세 또는 물체 레이블을 제거할 경우 정확도가 감소함(각각 93.57% 및 91.65%)으로, 이들이 중요한 요소임을 입증했다.
  • 어텐션 시각화 결과, 행동 블록이 행동을 정의하는 关건 프레임(예: '에스프레소 꺼내기'의 최종 프레임)에 가장 강하게 주목함을 확인했다.
  • 시계열 창크 크기를 16에서 128로 늘일 경우 FPHA에서 행동 인식 정확도가 90.96%에서 94.09%로 향상되어 장거리 모델링의 타당성을 입증했다.
  • 단일 프레임 신호가 아닌 전체 시퀀스 맥락을 활용함으로써, 행동의 모호함을 효과적으로 해소함—예를 들어 '우유 따르기'와 '우유 놓기'를 구분할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.