Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Action Recognition with Permutation-invariant Attention

Hongguang Zhang, Li Zhang|arXiv (Cornell University)|2020. 01. 12.
Human Pose and Action Recognition참고 문헌 58인용 수 17
한 줄 요약

이 논문은 변동 길이의 비디오 클립과 시간적 분포 이동에 대응하기 위해 순열 불변 주의 메커니즘을 사용하는 few-shot 행동 인식 프레임워크를 제안한다. 블록 순열을 통한 증강 유도 주의와 자기지도 학습을 적용함으로써, SOTA보다 우수한 성능을 보이며 HMDB51, UCF101, miniMIT에서 강건한 불변 표현을 학습한다.

ABSTRACT

Many few-shot learning models focus on recognising images. In contrast, we tackle a challenging task of few-shot action recognition from videos. We build on a C3D encoder for spatio-temporal video blocks to capture short-range action patterns. Such encoded blocks are aggregated by permutation-invariant pooling to make our approach robust to varying action lengths and long-range temporal dependencies whose patterns are unlikely to repeat even in clips of the same class. Subsequently, the pooled representations are combined into simple relation descriptors which encode so-called query and support clips. Finally, relation descriptors are fed to the comparator with the goal of similarity learning between query and support clips. Importantly, to re-weight block contributions during pooling, we exploit spatial and temporal attention modules and self-supervision. In naturalistic clips (of the same class) there exists a temporal distribution shift--the locations of discriminative temporal action hotspots vary. Thus, we permute blocks of a clip and align the resulting attention regions with similarly permuted attention regions of non-permuted clip to train the attention mechanism invariant to block (and thus long-term hotspot) permutations. Our method outperforms the state of the art on the HMDB51, UCF101, miniMIT datasets.

연구 동기 및 목표

  • 라벨이 부족한 비디오 데이터와 시간적 위치에서 크게 달라지는 행동 패턴으로 인해 어려움을 겪는 few-shot 비디오 행동 인식 문제를 해결한다.
  • 동일한 클래스의 클립에서 행동 세그먼트가 다른 시간에 나타나는 시간 분포 이동 문제를 해결하기 위해 주의 메커니즘이 블록 순열에 대해 불변이 되도록 한다.
  • C3D 기반의 스파ati오-시간 인코딩과 순열 불변 풀링, 자기지도 학습을 조합하여 저데이터 환경에서의 표현 학습을 향상시킨다.
  • 질의와 지원 클립 간의 유사도를 주의 가중 풀링 표현을 사용해 학습하는 관계 기반 비교기 개발

제안 방법

  • 3D 합성곱을 통해 짧은 범위의 행동 패턴을 포착하는 C3D 백본을 사용해 비디오 클립의 스파티오-시간 특징을 추출한다.
  • 변동 길이의 클립 표현을 고정 길이 벡터로 요약하기 위해 순열 불변 풀링을 적용하며, 장기적 비반복적 의존성은 기각한다.
  • 증강 유도 주의 메커니즘 도입: 훈련 중 클립 블록을 순열하고, 순열된 및 비순열된 경로에서의 주의 가중치를 대비 손실을 통해 정렬한다.
  • 자기지도 학습을 위해 재배열 및 회전 증강을 활용하여 인코더, 비교기, 주의 모듈을 사전학습함으로써 저샷 조건에서의 강건성을 향상시킨다.
  • 질의 및 지원 클립 표현을 주의 가중 특징을 통합하여 관계 기반 기술자 생성 후, 유사도 비교기로 few-shot 분류 수행.
  • 일관된 유사도를 유도하는 대비 손실을 사용해 전체 파ipeline를 엔드 투 엔드로 훈련함: 일치하는 질의-지원 쌍 간 유사도는 높이고, 일치하지 않는 쌍 간 유사도는 낮춘다.

실험 결과

연구 질문

  • RQ1비디오 블록의 시간적 및 공간적 순열에 대해 주의 메커니즘이 불변이 되도록 할 수 있을까? 이는 few-shot 행동 인식에서의 강건성을 향상시킬 수 있는가?
  • RQ2순열 불변 풀링과 주의 메커니즘의 조합이, 행동 세그먼트가 반복적이지 않고 클립 간 시간적으로 변동성이 큰 경우 일반화 성능을 어떻게 향상시키는가?
  • RQ3재배열 및 회전 증강을 통한 자기지도 사전학습이 저데이터 비디오 인식에서 특징 표현 품질을 어느 정도 향상시키는가?
  • RQ4주의 정규화된 풀링 표현을 기반으로 훈련된 관계 기반 비교기가 질의 및 지원 클립 간의 유사도를 효과적으로 학습할 수 있는가?
  • RQ5제안된 방법이 HMDB51, UCF101, miniMIT와 같은 표준 few-shot 행동 인식 벤치마크에서 최신 기술(SOTA) 성능을 달성하는가?

주요 결과

  • 제안된 방법은 표준 few-shot 평가 프로토콜을 기준으로 HMDB51 데이터셋에서 SOTA 성능을 달성하며, 이전 방법보다 뛰어난 성능을 보였다.
  • UCF101 데이터셋에서 기존 베이스라인 대비 유의미한 향상을 보였으며, 특히 지원 샘플 수가 제한된 저샷 설정에서 두드러졌다.
  • miniMIT 데이터셋에서 높은 클래스 다양성과 복잡한 행동 변동성에도 불구하고, 이전 접근법보다 높은 정확도를 기록하여 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과, 순열 불변 주의와 자기지도 학습의 조합이 시간 분포 이동 상황에서 주의 맵의 정렬 오차를 감소시킴을 확인했다.
  • 증강 유도 주의(순열된 및 비순열된 클립 뷰 간 주의 가중치 정렬)를 사용함으로써 더 안정적이고 분류에 유용한 특징 학습이 가능했다.
  • 자기지도 사전학습과 주의 정규화를 적용한 모델은 다양한 few-shot 설정에서 일관된 정확도 향상을 보였으며, 성능 향상이 지속되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.