Skip to main content
QUICK REVIEW

[논문 리뷰] Combined CNN Transformer Encoder for Enhanced Fine-grained Human Action Recognition

Mei Chee Leong, Haosong Zhang|arXiv (Cornell University)|2022. 08. 03.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 미세한 인간 행동 인식을 위한 두 가지 하이브리드 CNN-Transformer 아키텍처를 제안한다: 3D 비전 트랜스포머 인코더와 비디오-텍스트 크로스 트랜스포머 인코더. 3D CNN 특징과 자기 주의 및 크로스 주의 메커니즘을 조합함으로써, 모델들은 향상된 시간적 의미론과 시각-언어적 크로스 주의를 학습하며, FineGym 벤치마크에서 Gym99에서 94.6%의 top-1 정확도와 Gym288에서 90.1%의 정확도로 새로운 최고 성능을 달성한다.

ABSTRACT

Fine-grained action recognition is a challenging task in computer vision. As fine-grained datasets have small inter-class variations in spatial and temporal space, fine-grained action recognition model requires good temporal reasoning and discrimination of attribute action semantics. Leveraging on CNN's ability in capturing high level spatial-temporal feature representations and Transformer's modeling efficiency in capturing latent semantics and global dependencies, we investigate two frameworks that combine CNN vision backbone and Transformer Encoder to enhance fine-grained action recognition: 1) a vision-based encoder to learn latent temporal semantics, and 2) a multi-modal video-text cross encoder to exploit additional text input and learn cross association between visual and text semantics. Our experimental results show that both our Transformer encoder frameworks effectively learn latent temporal semantics and cross-modality association, with improved recognition performance over CNN vision model. We achieve new state-of-the-art performance on the FineGym benchmark dataset for both proposed architectures.

연구 동기 및 목표

  • 클래스 간 차이가 미미하고 강력한 시간적 추론과 의미적 구분이 필요한 미세한 행동 인식 과제를 해결한다.
  • CNN(공간-시간 특징 추출)과 트랜스포머(전역적 의존성 모델링)의 상호보완적 강점을 활용하여 인식 정확도를 향상시킨다.
  • 시각적으로 유사한 행동의 구분을 향상시키기 위해 시각적 특징과 텍스트 기술 간 약한 감독 기반 크로스 주의를 탐색한다.
  • 미세한 체조 행동 인식에 도전적인 데이터셋인 FineGym 벤치마크에서 최고 성능을 달성한다.
  • 잠재적 의미론적 및 시간적 의존성을 포착하는 데 있어 순수 시각적 및 다중모달 비디오-텍스트 인코더의 효과성을 조사한다.

제안 방법

  • 비디오 클립에서 공간-시간 특징을 추출하기 위해 3D CNN 기반( SlowOnly)을 사용하여 시각적 토큰으로 변환한다.
  • 시각적 토큰을 트랜스포머 인코더에 입력하여 장거리 시간적 의존성을 모델링하고 잠재적 의미 표현을 학습한다.
  • 크로스 인코더의 경우, 행동 클래스의 텍스트 기술을 추출하고 이를 텍스트 토큰으로 임bedding한 후, 공유된 트랜스포머 인코더에서 시각적 토큰과 함께 처리한다.
  • 행동 클래스 레이블로부터 약한 감독을 사용하여 크로스 인코더를 훈련함으로써, 지표 속성 레이블의 정렬 정보 없이도 종단간 학습을 통해 시각-언어 주의를 가능하게 한다.
  • 훈련에 AdamW 옵timizer를 사용하고, 학습률 스케줄링으로 코즈인 애너일링을 적용하며, 가중치 감쇠는 0.05로 설정한다.
  • 특징 수준의 융합과 다중 헤드 자기 주의 메커니즘을 도입하여 효과적인 다중 모odal 상호작용과 표현 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1트랜스포머 인코더는 CNN가 추출한 시각적 특징에서 미세한 행동 인식에서 잠재적 시간적 의미론을 효과적으로 학습할 수 있는가?
  • RQ2텍스트 기술을 통합함으로써, 시각적으로 유사한 미세한 행동의 구분 능력은 어느 정도 향상되는가?
  • RQ3지표 수준의 애너테이션 없이도 의미 있는 시각-언어적 연관성을 학습하는 데 약한 감독 기반의 비디오-텍스트 크로스 주의는 얼마나 효과적인가?
  • RQ4CNN과 트랜스포머 아키텍처의 통합은 순수 CNN 또는 시각 전용 트랜스포머 기반 베이스라인보다 미세한 벤치마크에서 더 우수한 성능을 내는가?
  • RQ5복잡하고 속성 기반의 행동 데이터셋에서 전체 인식 정확도에 대해 시각적 및 텍스트 모odal 간 크로스 주의의 기여도는 어떠한가?

주요 결과

  • 3D 비전 트랜스포머 인코더는 Gym99에서 94.0%의 top-1 정확도와 Gym288에서 90.5%의 정확도를 기록하여, TSN, TRNms, TSM, I3D, NL I3D를 포함한 모든 CNN 기반 베이스라인을 초월했다.
  • 비디오-텍스트 크로스 트랜스포머 인코더는 Gym99에서 94.6%의 top-1 정확도와 Gym288에서 90.1%의 정확도를 기록하여 FineGym 벤치마크에서 새로운 최고 성능을 수립했다.
  • 크로스 인코더 프레임워크는 SlowOnly 베이스라인 대비 Gym288에서 3.28%p의 top-1 정확도 향상을 보이며, 약한 감독 기반의 시각-언어적 정렬의 유용성을 입증했다.
  • VT 크로스 인코더는 이전 최고 성능 모델인 TQN(쿼리-응답 메커니즘 사용)보다 Gym99에서 0.8%p, Gym288에서 0.5%p 높은 성능을 기록하여 더 뛰어난 크로스 인코딩 능력을 보였다.
  • 제안된 두 모델 모두 SlowOnly 베이스라인에 비해 크게 향상되었으며, 특히 크로스 인코더가 가장 큰 성과를 보여 다중모달 학습의 가치를 입증했다.
  • 결과는 전역적 시간적 의미론과 다중모달 연관성을 학습함으로써, 미세한 공간적·시간적 차이를 가지는 행동 인식에서의 구분 능력 향상이 가능하다는 것을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.