Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Feature Aggregation Networks for Video Action Recognition

Swathikiran Sudhakaran, Sérgio Escalera|arXiv (Cornell University)|2019. 05. 29.
Human Pose and Action Recognition참고 문헌 29인용 수 5
한 줄 요약

이 논문은 계층적 특징 집합 네트워크(HF-Net)를 제안하며, 이는 인접한 특징 브랜치 간의 동적이고 학습 가능한 상호작용을 통해 각 레이어에서 특징 차분과 평균화 사이의 균형을 이루는 컨volution 게이팅을 통해 영상 행동 인식을 향상시키는 경량 모듈이다. 이 방법은 추가 파rameter가 1.14% 증가하고 FLOPs가 1.04% 증가하는 데서도 Something-Now에서 성능을 24% 이상 향상시키며, 보수적인 라우팅을 통해 특징 흐름을 유지한다.

ABSTRACT

Most action recognition methods base on a) a late aggregation of frame level CNN features using average pooling, max pooling, or RNN, among others, or b) spatio-temporal aggregation via 3D convolutions. The first assume independence among frame features up to a certain level of abstraction and then perform higher-level aggregation, while the second extracts spatio-temporal features from grouped frames as early fusion. In this paper we explore the space in between these two, by letting adjacent feature branches interact as they develop into the higher level representation. The interaction happens between feature differencing and averaging at each level of the hierarchy, and it has convolutional structure that learns to select the appropriate mode locally in contrast to previous works that impose one of the modes globally (e.g. feature differencing) as a design choice. We further constrain this interaction to be conservative, e.g. a local feature subtraction in one branch is compensated by the addition on another, such that the total feature flow is preserved. We evaluate the performance of our proposal on a number of existing models, i.e. TSN, TRN and ECO, to show its flexibility and effectiveness in improving action recognition performance.

연구 동기 및 목표

  • 고정된 집합 전략의 한계를 해결하기 위해, 예를 들어 고정된 특징 차분 또는 풀링 전략이 입력에 따라 변화하는 시간 동적 특성에 적응하지 못하는 문제를 해결한다.
  • 3D 컨볼루션 또는 외부 광학 흐름에 의존하지 않고도 깊이 있는 네트워크가 시간이 지남에 따라 더 큰 수신장(Receptive Field)을 갖도록 한다.
  • 기존의 2D-CNN 기반 백본(예: TSN, TRN, ECO)에 추가로 통합할 수 있는 플러그인 모듈을 설계하여 최소한의 파라미터 및 FLOP 오버헤드를 유도한다.
  • 각 레이어에서 특징의 국소적 적응형 융합을 학습하기 위해, 컨볼루션 게이팅을 통해 차분과 평균화 사이에서 동적으로 선택하는 방법을 제안한다.
  • 이동 기반 배포를 위한 낮은 추론 비용을 유지하면서도 행동 인식 벤치마크에서 경쟁 가능한 성능을 달성한다.

제안 방법

  • 핵심 구성 요소는 CNN 백본의 각 레이어에서 인접한 특징 브랜치를 처리하는 HF 모듈이다.
  • 각 레이어에서 네트워크는 게이팅 잔차를 계산한다: 특징이 한 브랜치에서 빼지고 인접한 브랜치에 더해지며, 이는 학습 가능한 컨볼루션 게이팅을 통해 이루어진다.
  • 게이팅은 엔드 투 엔드로 훈련되며, 국소적으로 특징 차분 또는 평균화가 적용될지를 결정하여 적응형 시간적 추론을 가능하게 한다.
  • 정보 손실을 방지하기 위해 특징 흐름의 총합을 유지하는 보수적인 라우팅을 강제한다.
  • 이 모듈은 플러그 앤 플레이 방식이며, TSN, TRN, ECO를 포함한 2D-CNN 기반 영상 모델과 호환된다.
  • 네트워크는 엔드 투 엔드로 훈련되며, 게이팅이 입력에 따라 의존적인 융합 전략을 학습하여 스펙트로-시간적 표현 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1인접한 특징 브랜치 간의 학습 가능한 동적 상호작용이 고정된 집합 방법을 초월해 영상 행동 인식을 향상시킬 수 있는가?
  • RQ2이러한 메커니즘이 3D 컨볼루션을 사용하지 않고도 2D-CNN 백본의 시간적 수신장을 효과적으로 확장할 수 있는가?
  • RQ3제안된 계층적 특징 집합이 최소한의 계산 오버헤드로 성능 향상을 달성할 수 있는가?
  • RQ4이 방법은 다양한 백본 아키텍처와 데이터셋에 일반화 가능한가?
  • RQ5낮은 FLOP 및 파라미터 비용으로 장시간 시퀀스 및 복잡한 인간-물체 상호작용 영상에서 뛰어난 성능을 낼 수 있는가?

주요 결과

  • HF-Net은 TSN에 적용되었을 때 Something-Now 데이터셋에서 정확도를 24.2% 향상시키며, 추가 파라미터는 1.14% 증가하고 FLOPs는 1.04% 증가한다.
  • HMDB51에서 HF-증강 모델(TSN, TRN, ECOLite)은 모든 베이스라인에서 2% 이상의 정확도 향상을 달성했으며, 일부 경우에서 더 큰 3D CNN보다 뛰어난 성능을 보였다.
  • HF-TSN은 EPIC-KITCHENS에서 RGB 및 광학 흐름 스트림을 모두 활용해 액트 분류(S1)에서 12% 향상되고 S2 설정에서는 8% 향상되었다.
  • 이 방법은 Something-Now, HMDB51, EPIC-KITCHENS 세 가지 벤치마크에서 모두 경쟁 가능한 성능을 달성하면서도 낮은 계산 비용을 유지한다.
  • ECOLite는 전체 3D CNN보다 3D 컨볼루션 수가 적은 모델이지만, HF 모듈이 성능 향상을 이끌어내어, 일부 경우에서 계층적 특징 집합이 밀집된 3D 컨볼루션보다 더 효과적임을 보여준다.
  • 제거 실험 결과, 고정된 차분 또는 평균화 전략은 적응형 라우팅 메커니즘에 비해 성능이 열 劣하므로, 학습 가능한 게이팅이 핵심임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.