[논문 리뷰] DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition
DirecFormer는 비디오 프레임의 정확한 시간적 순서를 명시적으로 모델링하기 위해 Directed Attention 메커니즘을 갖춘 새로운 Transformer 기반 프레임워크를 제안한다. 공간적 및 시간적 차원에서 방향성 있는 어텐션을 통합하고, 자기지도 학습 기반 가이드 손실을 사용함으로써 Kinetics-400에서 SOTA 성능(82.75% top-1)을 달성하면서도 이전 방법들보다 훨씬 낮은 추론 비용을 기록한다.
Human action recognition has recently become one of the popular research topics in the computer vision community. Various 3D-CNN based methods have been presented to tackle both the spatial and temporal dimensions in the task of video action recognition with competitive results. However, these methods have suffered some fundamental limitations such as lack of robustness and generalization, e.g., how does the temporal ordering of video frames affect the recognition results? This work presents a novel end-to-end Transformer-based Directed Attention (DirecFormer) framework for robust action recognition. The method takes a simple but novel perspective of Transformer-based approach to understand the right order of sequence actions. Therefore, the contributions of this work are three-fold. Firstly, we introduce the problem of ordered temporal learning issues to the action recognition problem. Secondly, a new Directed Attention mechanism is introduced to understand and provide attentions to human actions in the right order. Thirdly, we introduce the conditional dependency in action sequence modeling that includes orders and classes. The proposed approach consistently achieves the state-of-the-art (SOTA) results compared with the recent action recognition methods, on three standard large-scale benchmarks, i.e. Jester, Kinetics-400 and Something-Something-V2.
연구 동기 및 목표
- 혼자서나 잘못된 순서로 배열된 비디오 프레임에 대응할 때 기존 행동 인식 모델의 강건성 부족 문제를 해결한다.
- 모델이 행동 인식 정확도를 향상시키기 위해 시간 순서를 수정할 수 있는지 조사한다.
- 공간적 및 시간적 차원에서 방향성 어텐션을 사용하여 행동의 정확한 순서를 명시적으로 모델링하는 방법을 개발한다.
- 행동 클래스와 프레임 순서 간의 조건부 종속성을 도입하여 일반화 능력을 향상시킨다.
- 이전의 3D-CNN 및 Transformer 기반 방법들에 비해 계산 비용을 줄이고도 SOTA 성능을 달성한다.
제안 방법
- 공간적 및 시간적 차원에서 프레임과 토큰 간의 어텐션 크기뿐 아니라 방향성까지 학습하는 Directed Attention 메커니즘을 제안한다.
- 방향성 상관관계를 모델링하는 방향성 있는 시간 어텐션 모듈을 도입하여, 어텐션 맵에서 초록색(양성)과 빨간색(음성) 화살표로 표현한다.
- 어텐션의 흐름이 올바른 시간 방향으로 향하도록 유도하기 위해 자기지도 학습 기반 가이드 손실을 사용한다.
- 추론 중에 뒤섞인 프레임 순서를 수정하기 위해 해밀토니안 경로 탐색 알고리즘을 적용하여, 모델이 올바른 순서를 재구성할 수 있는 능력을 검증한다.
- 행동 클래스와 그 정확한 시간 순서를 함께 학습하는 조건부 종속성 모델링 전략을 적용한다.
- ImageNet-21K 사전학습을 사용하여 엔드 투 엔드로 모델을 훈련하며, 추론 시 3개의 공간적 클립과 단일 시간 클립만을 사용하여 계산 비용을 줄인다.
실험 결과
연구 질문
- RQ1비디오 프레임이 원래 시간 순서에서 뒤섞였을 때 행동 인식 모델이 높은 정확도를 유지할 수 있는가?
- RQ2잘못된 순서로 배열된 비디오 프레임의 시간 순서를 얼마나 잘 수정하여 인식 성능을 향상시킬 수 있는가?
- RQ3공간적 및 시간적 차원에서 방향성 어텐션을 통합하면 행동 인식의 강건성과 정확도가 향상되는가?
- RQ4표준 소프트맥스 또는余弦 어텐션과 비교했을 때 제안된 방향성 어텐션 메커니즘은 시간적 순서 의존성을 얼마나 잘 모델링하는가?
- RQ5자기지도 학습 기반 가이드 손실이 행동 시퀀스의 정확한 순서를 학습하는 데 효과적으로 기여하는가?
주요 결과
- DirecFormer는 Kinetics-400에서 SOTA 성능을 기록하며, top-1 정확도가 82.75%에 달한다. 이는 TimeSFormer-L보다 약 2% 높은 성능이다.
- 3개의 시야(1 클립 × 3 클립)만을 사용함으로써 경쟁적인 성능를 유지하면서도, 이전 방법들이 사용하는 30개의 시야에 비해 추론 비용을 크게 줄였다.
- 시간적 및 공간적 차원에서 C-C(코시-코시) 어텐션을 사용할 경우 가장 높은 성능를 기록하여, 방향성 어텐션의 효과를 입증한다.
- Jester에서의 추상화 분석 결과, 제안된 방향성 어텐션 메커니즘과 가이드 손실이 표준 어텐션 메커니즘보다 인식 정확도를 크게 향상시킨다.
- 정성적 결과는 해밀토니안 경로 탐색을 어텐션 맵에 적용하여, 뒤섞인 파크르 행동 비디오의 올바른 프레임 순서를 성공적으로 재구성할 수 있음을 확인한다.
- TimeSFormer와 유사한 모델 크기와 GFLOPs를 가짐에도 불구하고, DirecFormer는 Kinetics-400, Jester, Something-Something-V2의 세 가지 벤치마크에서 모두 더 높은 정확도를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.