[논문 리뷰] ActionFormer: Localizing Moments of Actions with Transformers
ActionFormer는 단일 단계, 앵커 기반 아님 Transformer 모델을 제안하여 비디오의 모든 순간을 분류하고, 국소 자기주의 및 경량 디코더를 사용하여 행동 경계를 회귀시킨다. 행동 제안이나 앵커 창을 사용하지 않아도 THUMOS14에서 tIoU=0.5일 때 71.0% mAP를 달성하여 이전 방법보다 14.1个百分点 높게 성과를 냈다.
Self-attention based Transformer models have demonstrated impressive results for image classification and object detection, and more recently for video understanding. Inspired by this success, we investigate the application of Transformer networks for temporal action localization in videos. To this end, we present ActionFormer -- a simple yet powerful model to identify actions in time and recognize their categories in a single shot, without using action proposals or relying on pre-defined anchor windows. ActionFormer combines a multiscale feature representation with local self-attention, and uses a light-weighted decoder to classify every moment in time and estimate the corresponding action boundaries. We show that this orchestrated design results in major improvements upon prior works. Without bells and whistles, ActionFormer achieves 71.0% mAP at tIoU=0.5 on THUMOS14, outperforming the best prior model by 14.1 absolute percentage points. Further, ActionFormer demonstrates strong results on ActivityNet 1.3 (36.6% average mAP) and EPIC-Kitchens 100 (+13.5% average mAP over prior works). Our code is available at http://github.com/happyharrycn/actionformer_release.
연구 동기 및 목표
- 행동 제안이나 앵커 창에 의존하지 않는 단순하면서도 강력한 Transformer 기반 모델을 개발하는 것.
- 장거리 시간적 의존성을 모델링하기 위해 국소 자기주의와 특징 피라미드 통합의 효과성을 조사하는 것.
- 다양한 벤치마크, 특히 컷팅되지 않은 비디오와 이교적 비디오를 포함하여 시간 행동 정위의 강력한 단일 단계 기반을 수립하는 것.
- 기본적인 분류 및 회귀 손실을 사용하는 최소화된 설계가 복잡한 이단계 또는 앵커 기반 모델보다 우수한 성능을 낼 수 있음을 보여주는 것.
제안 방법
- ActionFormer는 두 개의 스트림 I3D 또는 SlowFast 백본을 사용하여 비디오에서 다중 척도 특징 표현을 추출한 후, 각 순간을 후보로 표현하기 위해 특징 피라미드를 적용한다.
- 장거리 시간적 맥락을 모델링하기 위해 국소 자기주의를 특징 피라미드에 적용하여 행동 후보 간의 의존성을 포착할 수 있도록 한다.
- 각 후보를 행동 카테고리로 분류하고, 각 후보에서 진짜 행동 시작 및 종료까지의 거리를 회귀하기 위해 경량 컨볼루션 디코더를 사용한다.
- 모델은 표준 교차 엔트로피 손실을 분류에, 스무스 L1 손실을 경계 회귀에 사용하여 엔드 투 엔드 최적화로 훈련된다.
- 추론은 예측된 점수와 오프셋을 디코딩하여 시간적 경계와 레이블을 갖는 행동 인스턴스를 생성하는 방식으로 이루어진다.
- 모델는 다양한 데이터셋에 동일하게 적용되며, 입력 특징은 해상도, 프레임 레이트, 모odal(예: THUMOS14에선 두 개의 스트림 I3D, EPIC-Kitchens에선 SlowFast)에 맞게 조정된다.
실험 결과
연구 질문
- RQ1행동 제안이나 사전 정의된 앵커 창을 사용하지 않고도 단일 단계, 앵커 기반 아님 Transformer 모델이 시간 행동 정위에서 최신 기술 성능을 달성할 수 있는가?
- RQ2국소 자기주의는 컷팅되지 않은 비디오에서 행동 정위의 장거리 시간적 의존성을 얼마나 효과적으로 모델링하는가?
- RQ3기본적인 손실을 사용하는 단순하고 통합된 아키텍처가 다양한 벤치마크에서 복잡한 이단계 또는 앵커 기반 모델보다 얼마나 뛰어나게 성능을 낼 수 있는가?
- RQ4모델은 컷팅되지 않은 비디오, 장시간 비디오, 이교적 비디오 등 다양한 비디오 도메인으로 일반화되는가?
주요 결과
- ActionFormer는 THUMOS14 벤치마크에서 tIoU=0.5일 때 71.0% mAP를 달성하여 이전 최고 성능 방법보다 14.1 점수 포인트 높은 성과를 냈다.
- ActivityNet 1.3에서 ActionFormer는 평균 mAP 36.6%를 기록하여 장꼬리 분포와 다양한 행동 분포에 대해 강력한 일반화 능력을 보였다.
- 도전적인 EPIC-Kitchens 100 데이터셋에서 ActionFormer는 이전 작업 대비 평균 mAP를 13.5점 이상 향상시켜 이교적 행동 정위에서의 효과성을 입증했다.
- 모델는 복잡한 제안 생성 또는 디코딩 파이프라인 없이도 단순한 최소화 설계와 표준 분류 및 회귀 손실만을 사용하여 이러한 성과를 달성했다.
- 광범위한 아블레이션 연구를 통해 국소 자기주의와 특징 피라미드의 중요성이 확인되었으며, 이들 구성 요소를 제거할 경우 성능이 크게 떨어지는 것으로 나타났다.
- 다양한 하드웨어 및 환경에서 재현 가능했으며, EPIC-Kitchens에서 mAP 변동 폭이 최대 0.8% 이내로 미미하여 모델의 강건성과 신뢰성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.