Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-temporal Relation Modeling for Few-shot Action Recognition

Anirudh Thatipelli, Sanath Narayan|arXiv (Cornell University)|2021. 12. 09.
Human Pose and Action Recognition인용 수 6
한 줄 요약

이 논문은 지역 패치 수준 및 전역 프레임 수준 특징 강화를 조합한 새로운 시공간 강화 모듈을 통해 특징의 구분 능력과 시간적 추론 능력을 향상시키는 few-shot 행동 인식 프레임워크인 STRM을 제안한다. 중간 단계의 쿼리-클래스 유사도 분류 및 낮은 카디널리티에서 고차원 시간적 관계 학습을 통해 STRM는 Kinetics, SSv2, HMDB51, UCF101에서 최신 기준 성능(SOTA)을 달성하였으며, SSv2에서 기존 최고 성능 대비 절대 정확도 향상 3.5%를 기록하였다.

ABSTRACT

We propose a novel few-shot action recognition framework, STRM, which enhances class-specific feature discriminability while simultaneously learning higher-order temporal representations. The focus of our approach is a novel spatio-temporal enrichment module that aggregates spatial and temporal contexts with dedicated local patch-level and global frame-level feature enrichment sub-modules. Local patch-level enrichment captures the appearance-based characteristics of actions. On the other hand, global frame-level enrichment explicitly encodes the broad temporal context, thereby capturing the relevant object features over time. The resulting spatio-temporally enriched representations are then utilized to learn the relational matching between query and support action sub-sequences. We further introduce a query-class similarity classifier on the patch-level enriched features to enhance class-specific feature discriminability by reinforcing the feature learning at different stages in the proposed framework. Experiments are performed on four few-shot action recognition benchmarks: Kinetics, SSv2, HMDB51 and UCF101. Our extensive ablation study reveals the benefits of the proposed contributions. Furthermore, our approach sets a new state-of-the-art on all four benchmarks. On the challenging SSv2 benchmark, our approach achieves an absolute gain of $3.5\%$ in classification accuracy, as compared to the best existing method in the literature. Our code and models are available at https://github.com/Anirudh257/strm.

연구 동기 및 목표

  • 제한된 지원 샘플로 인해 정확한 분류가 어려운 few-shot 행동 인식 문제를 해결한다.
  • 비디오 표현 내에서 공간적 및 시간적 맥락을 명시적으로 모델링하여 특징의 구분 능력을 향상시킨다.
  • 고정된 튜플 표현 방식과 맥락 강화의 부재로 인해 공간적 및 시간적 변동성에 취약한 기존 방법(예: TRX)의 한계를 극복한다.
  • 다양한 동작 속도, 오프셋, 간섭 요소가 존재하더라도 쿼리 및 지원 비디오 간의 강력한 시간적 관계 모델링을 가능하게 한다.
  • 적응형, 샘플 기반 특징 강화를 통해 낮은 카디널리티에서 고차원 시간적 관계를 학습함으로써 모델의 유연성을 향상시킨다.

제안 방법

  • 지역 패치 수준 강화(PLE)와 전역 프레임 수준 강화(FLE)를 포함한 두 가지 하위 모듈로 구성된 시공간 강화 모듈을 제안한다. PLE는 국소적인 외관 기반 맥락을 처리하고, FLE는 전역적인 시간적 맥락을 처리한다.
  • PLE에서 샘플 기반 자기주의 어텐션을 사용하여 각 프레임 내에서 행동 카테고리 간의 외관 유사성과 이질성을 포착한다.
  • FLE에서 샘플에 의존하지 않는 지속적 메모리 기반 집합을 구현하여 장거리 시간적 의존성과 비디오 전반의 물체 운동을 인코딩한다.
  • 패치 수준 특징에 쿼리-클래스 유사도 분류기를 도입하여 특징 학습 중에 클래스 기반의 구분 능력을 강화한다.
  • 쿼리 및 지원 서브시퀀스 간의 동적 튜플 매칭을 통해 고차원 시간적 관계를 학습하고, 고정된 카디널리티 브랜치에 대한 의존도를 감소시킨다.
  • GPU 메모리 제약로 인해 16회의 반복 동안 기울기 누적 기반으로 모델을 훈련시키며, 8개의 프레임을 균일하게 샘플링하고 중심 코너 추론을 사용한다.

실험 결과

연구 질문

  • RQ1명시적인 시공간 맥락 모델링이 few-shot 행동 인식에서 특징의 구분 능력을 향상시킬 수 있는가?
  • RQ2지역 패치 수준 및 전역 프레임 수준 특징 강화를 조합함으로써 few-shot 환경에서 시간적 관계 학습에 어떤 영향을 미치는가?
  • RQ3강화된 특징에 중간 단계의 분류 헤드를 도입하면 모델의 일반화 능력과 구분 능력이 향상되는가?
  • RQ4낮은 카디널리티에서 고차원 시간적 관계를 학습하는 것이 고정 브랜치 기반 접근 방식에 비해 모델의 유연성과 성능 향상에 기여하는가?
  • RQ5제안된 방법이 도전적인 few-shot 벤치마크에서 기존 최고 성능 방법을 얼마나 뛰어나게 성능을 내는가?

주요 결과

  • STRM는 Kinetics, SSv2, HMDB51, UCF101의 네 가지 few-shot 행동 인식 벤치마크에서 모두 새로운 최고 성능(SOTA)을 달성하였다.
  • 도전적인 SSv2 벤치마크에서 STRM는 기존 문헌상 최고 성능 방법 대비 절대 정확도 향상 3.5%를 기록하였다.
  • 질적 분석 결과, STRM는 미세한 2D 운동 차이가 있는 행동에서도 행동 관련 객체와 운동 패tern을 효과적으로 강조하는 것으로 나타났다.
  • 모델는 향상된 특징의 구분 능력과 시간적 추론 능력을 바탕으로 더 나은 대응 매칭 성능을 보였으며, 지원 비디오에서 더 우수한 대표성 있는 매칭이 이루어졌다.
  • 제거 실험 결과, 패치 수준 및 프레임 수준 강화 구성 요소, 그리고 중간 단계의 쿼리-클래스 유사도 분류기의 효과성이 확인되었다.
  • 다양한 객체, 배경, 간섭 운동이 존재하는 상황에서도 더 강력하고 구분 능력이 뛰어난 표현을 학습하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.