Skip to main content
QUICK REVIEW

[논문 리뷰] ViT-ReT: Vision and Recurrent Transformer Neural Networks for Human Activity Recognition in Videos

James Wensel, Hayat Ullah|arXiv (Cornell University)|2022. 08. 16.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 인간 활동 인식을 향상시키기 위해 시각적 변형기(ViT)를 활용한 공간적 특징 추출과 순환 변형기(ReT)를 활용한 시계열 모델링을 결합한 새로운 하이브리드 신경망 ViT-ReT를 제안한다. 이 방법은 CNN-RNN 모델과 유사한 정확도를 달성하면서도 훨씬 빠른 추론 속도와 낮은 메모리 사용량을 보이며, 실시간 및 엣지 기반 활동 인식 시스템에서 효율적이고 확장 가능한 대안으로서의 변형기의 잠재력을 입증한다.

ABSTRACT

Human activity recognition is an emerging and important area in computer vision which seeks to determine the activity an individual or group of individuals are performing. The applications of this field ranges from generating highlight videos in sports, to intelligent surveillance and gesture recognition. Most activity recognition systems rely on a combination of convolutional neural networks (CNNs) to perform feature extraction from the data and recurrent neural networks (RNNs) to determine the time dependent nature of the data. This paper proposes and designs two transformer neural networks for human activity recognition: a recurrent transformer (ReT), a specialized neural network used to make predictions on sequences of data, as well as a vision transformer (ViT), a transformer optimized for extracting salient features from images, to improve speed and scalability of activity recognition. We have provided an extensive comparison of the proposed transformer neural networks with the contemporary CNN and RNN-based human activity recognition models in terms of speed and accuracy.

연구 동기 및 목표

  • 현재의 CNN-RNN 모델이 인간 활동 인식에서 높은 계산 복잡도와 느린 추론 시간을 가지는 데 기인한 한계를 해결하기 위해.
  • 영상 기반 활동 인식에서 깊은 잔차 컨볼루션 신경망과 RNN의 대체로 가벼우며 확장 가능한 변형기 신경망(TNNs)의 잠재력을 탐색하기 위해.
  • ViT와 ReT의 조합이 정확도, 속도, 메모리 효율성 측면에서 영상 활동 인식 작업에서의 성능을 평가하기 위해.
  • 자원 제약이 있는 엣지 및 IoT 디바이스에서 TNN 기반 모델을 실시간 응용에 구현할 수 있는지의 가능성을 입증하기 위해.

제안 방법

  • 모델은 영상 프레임을 패치로 나누고 학습 가능한 위치 임베딩 및 멀티헤드 자기주의를 적용하여 시각적 변형기(ViT)를 사용해 공간적 특징을 추출한다.
  • 순환 변형기(ReT)는 영상 프레임의 시퀀스 간 시간적 의존성을 모델링하기 위해 자기주의 메커니즘을 활용하여 장거리 시간적 관계를 포착한다.
  • ViT와 ReT 구성 요소는 순차적으로 스택된다: ViT는 각 프레임을 독립적으로 처리하고, ReT는 얻어진 특징 시퀀스를 처리하여 최종 예측을 한다.
  • 표준 교차 엔트로피 손실을 사용하고 Adam 또는 유사 최적화 알고리즘을 통해 역전파를 통한 엔드 투 엔드 훈련이 수행된다.
  • ResNet에서 사용하는 복잡한 잔차 연결 및 계층적 특징 학습을 피하고, 대신 자기주의 기반 특징 집합에 의존한다.
  • 모델의 효율성은 추론 속도, 메모리 소비, 파라미터 수를 측정하여 표준 CNN-RNN 기준선과 비교한다.

실험 결과

연구 질문

  • RQ1시각적 변형기(ViT)는 인간 활동 인식을 위한 영상 프레임에서 공간적 특징을 효과적으로 추출할 수 있는가? CNN 기반 특징 추출기보다 우월하거나 동등한 성능을 보일 수 있는가?
  • RQ2순환 변형기(ReT)는 기존의 LSTMs나 GRUs와 같은 전통적인 RNN보다 영상 시퀀스의 시간적 의존성을 더 효율적으로 포착할 수 있는가?
  • RQ3ViT와 ReT의 조합은 CNN-RNN 파이프라인 대비 높은 정확도를 유지하면서도 추론 속도와 메모리 효율성을 크게 향상시킬 수 있는가?
  • RQ4TNNs는 엔드 투 엔드 인간 활동 인식 시스템에서 전통적인 CNN 및 RNN 구성 요소를 어느 정도 대체할 수 있는가?

주요 결과

  • ReT 모델은 전통적인 RNN 기반 분류기와 유사한 정확도를 달성하면서도 더 빠르고 메모리 효율적이므로, 활동 인식에서 순차적 모델링을 위한 변형기의 실현 가능성을 입증한다.
  • ViT-ReT 파이프라인은 기존의 CNN-RNN 모델보다 추론 속도와 메모리 효율성에서 뚜렷한 우수성을 보이며, 엣지 및 IoT 디바이스에의 배포에 적합하다.
  • ViT를 공간적 특징 추출에, ReT를 시간적 모델링에 사용하는 조합은 기존의 깊은 컨볼루션 신경망과 RNN 스택보다 더 확장 가능하고 병렬 처리가 가능한 아키텍처를 가능하게 한다.
  • 복잡한 잔차 컨볼루션 신경망과 RNN을 대체함에도 불구하고, 제안된 모델은 높은 정확도를 유지하며, 이는 자기주의 메커니즘이 영상 이해에서 계층적 특징 학습을 효과적으로 대체할 수 있음을 시사한다.
  • 결과적으로 TNNs는 실시간 및 자원 제약이 있는 환경에서 CNN-RNN 파이프라인에 비해 강력한 대안이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.