Skip to main content
QUICK REVIEW

[논문 리뷰] STAR-Transformer: A Spatio-temporal Cross Attention Transformer for Human Action Recognition

Dasom Ahn, Sangwon Kim|arXiv (Cornell University)|2022. 10. 14.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 인간 동작 인식을 향상시키기 위해 비디오 프레임과 인간 스켈레톤 시퀀스를 다중 클래스 토큰을 통해 공동으로 모델링하는 새로운 스파티오-temporal 크로스 어텐션 트랜스포머인 STAR-Transformer를 제안한다. 인코더-디코더 아키텍처에 전체, 지그재그, 이진 스파티오-temporal 어텐션 메커니즘을 통합함으로써, STAR-Transformer는 Penn-Action 및 NTU-RGB+D 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, F-Z(인코더) 및 F-B(디코더) 설정을 사용하여 98.7%의 정확도를 기록하였다.

ABSTRACT

In action recognition, although the combination of spatio-temporal videos and skeleton features can improve the recognition performance, a separate model and balancing feature representation for cross-modal data are required. To solve these problems, we propose Spatio-TemporAl cRoss (STAR)-transformer, which can effectively represent two cross-modal features as a recognizable vector. First, from the input video and skeleton sequence, video frames are output as global grid tokens and skeletons are output as joint map tokens, respectively. These tokens are then aggregated into multi-class tokens and input into STAR-transformer. The STAR-transformer encoder layer consists of a full self-attention (FAttn) module and a proposed zigzag spatio-temporal attention (ZAttn) module. Similarly, the continuous decoder consists of a FAttn module and a proposed binary spatio-temporal attention (BAttn) module. STAR-transformer learns an efficient multi-feature representation of the spatio-temporal features by properly arranging pairings of the FAttn, ZAttn, and BAttn modules. Experimental results on the Penn-Action, NTU RGB+D 60, and 120 datasets show that the proposed method achieves a promising improvement in performance in comparison to previous state-of-the-art methods.

연구 동기 및 목표

  • 자기 모달 간 별도의 교차 모odal 학습 서브모듈이 필요 없이 비디오와 스켈레톤 특징을 효과적으로 통합하는 데 도전하는 것.
  • 표준 비전 트랜스포머가 장거리 시간적 의존성과 다중 모달 스파티오-temporal 관계를 모델링하는 데 한계를 보이는 것을 극복하는 것.
  • RGB 비디오와 스켈레톤 데이터에서 구분 가능한 다중 특징 표현을 학습하는 통합형, 엔드 투 엔드 학습 가능한 아키텍처를 개발하는 것.
  • 표준 자기 어텐션에서 관찰되는 최종 프레임에 대한 과도한 의존도를 방지하기 위해 모든 시간 프레임에 걸쳐 균형 잡힌 어텐션을 가능하게 하여 인식 정확도를 향상시키는 것.
  • 공유된 CNN 기반 비디오 및 스켈레톤 입력에서 유도된 다중 클래스 토큰을 통해 효율적이고 확장 가능한 특징 집합을 가능하게 하는 것.

제안 방법

  • 모델은 비디오 프레임에서 글로벌 격자 토큰과 스켈레톤 시퀀스에서 관절 맵 토큰을 추출하기 위해 공유된 CNN을 사용하며, 이를 다중 클래스 토큰으로 집계하여 STAR-Transformer에 입력한다.
  • 인코더는 장거리 공간적 및 시간적 의존성을 다중 모달 간에 포괄적으로 포착하기 위해 전체 스파티오-temporal 어텐션(FAttn)과 새로운 지그재그 스파티오-temporal 어텐션(ZAttn) 모듈을 사용한다.
  • 디코더는 FAttn와 이진 스파티오-temporal 어텐션(BAttn) 모듈을 사용하여 다중 특징 표현을 재구성하고 정밀화하여 분류에 활용한다.
  • 아키텍처는 FAttn, ZAttn, BAttn가 시간과 공간에 걸쳐 국소적 및 전역적 특징 학습을 균형 있게 유지하도록 전략적으로 통합된 인코더-디코더 구조로 설계되어 있다.
  • 크로스 어텐션 메커니즘은 비디오와 스켈레톤 모달 간의 상호작용을 특별히 모델링하여 별도의 특징 융합 네트워크 없이도 공동 표현 학습을 가능하게 한다.
  • 표준 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 학습되며, Penn-Action 및 NTU-RGB+D 60/120과 같은 표준 벤치마크에서 성능이 평가된다.

실험 결과

연구 질문

  • RQ1자기 모달 간 별도의 교차 모달 학습 모듈이 필요 없이 통합형 트랜스포머 아키텍처가 비디오 프레임과 인간 스켈레톤 시퀀스에서 공동 표현을 효과적으로 학습할 수 있는가?
  • RQ2제안된 지그재그 및 이진 스파티오-temporal 어텐션 메커니즘이 표준 멀티헤드 자기 어텐션 대비 시간 모델링에서 어떤 개선을 이끌어내는가?
  • RQ3공유된 CNN 특징에서 유도된 다중 클래스 토큰의 사용이 모달 간 특징 정렬 및 표현 효율성을 향상시키는가?
  • RQ4인코더와 디코더에서 어텐션 모듈(FAttn, ZAttn, BAttn)의 최적 설정은 동작 인식 정확도를 극대화하는 데 어떤 영향을 미치는가?
  • RQ5제안된 어텐션 메커니즘이 최종 프레임에 대한 편향을 피하고 모든 시간 프레임에 걸쳐 균형 잡힌 어텐션을 보장하는 데 얼마나 효과적인가?

주요 결과

  • F-Z(인코더) 및 F-B(디코더) 설정에서 NTU-RGB+D 120 데이터셋에서 98.7%의 최고 정확도를 기록하여 이전 최신 기술 수준 방법들을 능가하였다.
  • 지그재그 및 이진 스파티오-temporal 어텐션 메커니즘을 사용함으로써, 표준 FAttn가 마지막 프레임에 크게 치우치는 것과 달리 모든 프레임에 걸쳐 균일한 어텐션 점수를 기록하였다.
  • FAttn만을 사용한 경우, 어텐션 점수가 행동의 마지막 세 프레임에 집중되어 초기 및 중간 시퀀스의 역학을 잘 모델링하지 못하는 것으로 나타났다.
  • 인코더에 ZAttn와 디코더에 BAttn를 조합함으로써, 특히 행동 전환 시점에서 더 균형 잡히고 정보가 풍부한 어텐션 맵을 생성하였다.
  • Penn-Action, NTU-RGB+D 60, NTU-RGB+D 120의 세 데이터셋 전반에 걸쳐 일관된 성능 향상을 기록하여 모델의 강건성과 일반화 능력을 입증하였다.
  • 제거 실험을 통해 층 수는 세 개 이하로 제한되어야 오버피팅을 방지할 수 있으며, 이 깊이에서 성능이 최고조에 이르렀다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.