Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Modal Learning with 3D Deformable Attention for Action Recognition

Sangwon Kim, Dasom Ahn|arXiv (Cornell University)|2022. 12. 12.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 동작 인식을 위해 3차원 가변 시공간 주의를 갖춘 다중 모odal 학습을 통한 3차원 변형 가능 트랜스포머를 제안한다. 이는 관련 관절과 시간 세그먼트에 집중하기 위해 적응형 시공간 주의를 사용한다. 사전 훈련 없이 NTU60, NTU120, FineGYM, PennAction에서 최신 기술 수준(SOTA) 성능을 달성하며, 관절과 시간 스트라이드 시각화를 통해 설명 가능한 주의를 제공한다.

ABSTRACT

An important challenge in vision-based action recognition is the embedding of spatiotemporal features with two or more heterogeneous modalities into a single feature. In this study, we propose a new 3D deformable transformer for action recognition with adaptive spatiotemporal receptive fields and a cross-modal learning scheme. The 3D deformable transformer consists of three attention modules: 3D deformability, local joint stride, and temporal stride attention. The two cross-modal tokens are input into the 3D deformable attention module to create a cross-attention token with a reflected spatiotemporal correlation. Local joint stride attention is applied to spatially combine attention and pose tokens. Temporal stride attention temporally reduces the number of input tokens in the attention module and supports temporal expression learning without the simultaneous use of all tokens. The deformable transformer iterates L-times and combines the last cross-modal token for classification. The proposed 3D deformable transformer was tested on the NTU60, NTU120, FineGYM, and PennAction datasets, and showed results better than or similar to pre-trained state-of-the-art methods even without a pre-training process. In addition, by visualizing important joints and correlations during action recognition through spatial joint and temporal stride attention, the possibility of achieving an explainable potential for action recognition is presented.

연구 동기 및 목표

  • 시공간 동작 인식을 위한 비전 트랜스포머에서 고정된 수신 영역의 한계를 해결하기 위해.
  • 단일 트랜스포머 아키텍처 내에서 영상과 스켈레톤 모달 간 효과적인 다중 모달 학습을 가능하게 하기 위해.
  • 적응형 주의 메커니즘을 통해 계산 복잡도를 줄이고 시공간 상관관계를 유지하기 위해.
  • 동작 인식 중 핵심 관절과 시간 세그먼트를 시각화하여 설명 가능한 주의 맵을 제공하기 위해.

제안 방법

  • 모든 토큰에 주의를 기울이지 않고 관련이 있는 시공간 토큰을 적응형으로 선택하는 3차원 변형 가능 주의 모듈을 도입하여 계산 비용을 감소시키고 특징 집중도를 향상시킨다.
  • 단일 트랜스포머 블록 내에서 영상 모달과 자세 모달 간 이중 방향적 문맥 교환을 가능하게 하는 다중 모달 토큰 메커니즘을 활용한다.
  • 스ライ딩 윈도우를 사용해 관절 토큰을 그룹화함으로써 공간 상관관계를 유지하면서도 효율성을 향상시키는 국소 관절 스트라이드 주의를 적용한다.
  • 시간에 따라 입력 토큰을 다운샘플링하는 시간 스트라이드 주의를 사용하여 시퀀스 길이를 줄이면서 장거리 시간적 의존성을 유지한다.
  • 3개의 주의 모듈—3차원 변형 가능 주의, 국소 관절 스트라이드 주의, 시간 스트라이드 주의—를 하나의 반복적 트랜스포머 블록에 통합하여 엔드 투 엔드 특징 학습을 수행한다.
  • 스켈레톤 데이터를 관절 토큰으로 변환하고, 크로스 어텐션을 통해 영상 특징과 융합함으로써 보조 하위모델이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1적응형으로 관련 영역에 집중함으로써 3차원 변형 가능 주의 메커니즘이 비전 트랜스포머의 시공간 특징 학습을 향상시킬 수 있는가?
  • RQ2별도의 인코더 없이도 단일 트랜스포머 아키텍처 내에서 다중 모달 토큰을 활용한 영상과 스켈레톤 모달의 융합이 얼마나 효과적인가?
  • RQ3국소 관절 스트라이드 주의와 시간 스트라이드 주의가 공간-시간 상관관계를 유지하면서 효율성과 성능을 얼마나 향상시키는가?
  • RQ4제안된 주의 메커니즘이 인간이 인식하는 핵심 동작 구성 요소와 일치하는 설명 가능한 주의 맵을 생성할 수 있는가?
  • RQ5정확도와 계산 비용의 균형을 고려할 때 최적의 입력 프레임 수와 주의 윈도우 구성은 무엇인가?

주요 결과

  • 제안된 3차원 변형 가능 주의는 PennAction 데이터셋에서 상위-1 정확도 99.7%를 달성하여 이 구성 요소가 없는 모델보다 뛰어난 성능을 보였다.
  • 제거 실험 결과, 3D 변형 가능 주의를 제거하면 정확도가 4.9%p 감소하여 성능 향상에 핵심적인 역할을 함을 확인했다.
  • 다중 모달 토큰을 사용함으로써 정확도가 토큰 없이 92.2%에서 99.7%로 향상되어 다중 모달 특징 융합에서의 효과를 입증했다.
  • PennAction 데이터셋에서 최적의 입력 프레임 수는 12로 확인되었으며, 이보다 적은 프레임을 사용할 경우 성능이 떨어졌다.
  • 윈도우 크기의 절반 크기의 스트라이드를 가진 시간 스트라이드 주의가 가장 뛰어난 성능을 보였으며, 이는 중간 정도의 겹침이 시간적 상관관계 학습을 향상시킨다는 것을 시사한다.
  • 시각화 결과, 주의가 움직이는 관절(예: 머리, 오른팔, 오른다리)에서 강하게 활성화됨을 확인하여 행동 역학과의 일치를 확인하고 모델의 해석 가능성도 뒷받침했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.