Skip to main content
QUICK REVIEW

[논문 리뷰] LAP-Net: Adaptive Features Sampling via Learning Action Progression for Online Action Detection

Sanqing Qu, Guang Chen|arXiv (Cornell University)|2020. 11. 16.
Human Pose and Action Recognition참고 문헌 24인용 수 12
한 줄 요약

LAP-Net는 학습된 행동 진행 단계에 기반해 보조 특징을 적응적으로 샘플링하는 새로운 온라인 행동 탐지 프레임워크를 제안한다. Gumbel-Softmax를 사용하여 각 시간 단계에서 과거 또는 미래의 최적의 시간 범위를 미분 가능하게 선택한다. 이는 행동 단계에 따라 동적으로 특징을 샘플링하는 방식으로, 강화 학습 없이 엔드 투 엔드 학습을 통해 상태최고 수준의 mAP 스코어를 달성하며, TVSeries, THUMOS-14, HDD에서 최신 기술을 크게 앞서는 성능을 보인다.

ABSTRACT

Online action detection is a task with the aim of identifying ongoing actions from streaming videos without any side information or access to future frames. Recent methods proposed to aggregate fixed temporal ranges of invisible but anticipated future frames representations as supplementary features and achieved promising performance. They are based on the observation that human beings often detect ongoing actions by contemplating the future vision simultaneously. However, we observed that at different action progressions, the optimal supplementary features should be obtained from distinct temporal ranges instead of simply fixed future temporal ranges. To this end, we introduce an adaptive features sampling strategy to overcome the mentioned variable-ranges of optimal supplementary features. Specifically, in this paper, we propose a novel Learning Action Progression Network termed LAP-Net, which integrates an adaptive features sampling strategy. At each time step, this sampling strategy first estimates current action progression and then decide what temporal ranges should be used to aggregate the optimal supplementary features. We evaluated our LAP-Net on three benchmark datasets, TVSeries, THUMOS-14 and HDD. The extensive experiments demonstrate that with our adaptive feature sampling strategy, the proposed LAP-Net can significantly outperform current state-of-the-art methods with a large margin.

연구 동기 및 목표

  • 온라인 행동 탐지에서 보조 특징에 대한 고정된 시간 범위의 한계를 해결하기 위해, 행동 단계에 따라 모델이 잘못된 방향으로 유도될 수 있는 문제를 해결한다.
  • 추론 중에 행동 진행 단계를 동적으로 모델링하여 맥락 인식 특징 선택을 가능하게 한다.
  • 강화 학습에 의존하지 않고, 이산 특징 범위 선택을 위한 미분 가능한 Gumbel-Softmax를 사용하여 복잡한 강화 학습을 제거한다.
  • 현재 행동 단계에 맞춰 특징 집합을 적응적으로 조정함으로써 실시간 영상 스트림에서 탐지 정확도를 향상시킨다.

제안 방법

  • LAP-Net는 각 시간 단계에서 행동 진행 단계를 추정하기 위해 전용 진행도 헤드를 사용하는 행동 진행도 학습 네트워크를 도입한다.
  • 이러한 방법으로는 이산 분포에서 가능한 시간 범위에 대해 Gumbel-Softmax 기법을 사용해 특징을 미분 가능하게 샘플링한다.
  • 추정된 행동 진행 단계 단계에 따라 과거 관측 또는 미래 예측 특징을 적응적으로 선택한다.
  • 선택된 시간 범위의 보조 특징은 현재 특징과 융합되어 행동 분류에 사용된다.
  • 전체 네트워크는 강화 학습이나 보상 설계 없이 백프로파게이션을 통해 엔드 투 엔드로 학습된다.
  • 모델은 동적 시간 범위 선택을 지원하며, 최적의 범위는 행동 단계(초기, 중기, 후기)에 따라 달라진다.

실험 결과

연구 질문

  • RQ1행동 진행 단계는 온라인 행동 탐지에서 보조 특징의 최적 선택에 어떤 영향을 미치는가?
  • RQ2행동 단계에 기반해 과거 또는 미래 특징을 적응적으로 샘플링하는 것이 고정된 범위 집합에 비해 탐지 성능 향상에 기여하는가?
  • RQ3강화 학습 없이도 이산 특징 샘플링 모듈을 엔드 투 엔드로 학습할 수 있는가?
  • RQ4다양한 데이터셋에서 시간 범위 크기와 진행 상태 공간의 크기가 모델 성능에 미치는 영향은 어떠한가?

주요 결과

  • LAP-Net는 TVSeries에서 85.3%의 상태최고 수준 mAP를 달성하여 이전 최신 기술보다 크게 앞서는 성능을 보였다.
  • THUMOS-14에서는 53.3% mAP를 기록하여 고정된 범위 샘플링 기반 이전 최고 성능인 52.6%보다 뚜렷한 향상을 보였다.
  • HDD에서는 45.1% mAP를 기록하여 다양한 행동 속도를 가진 데이터셋 간의 강건성을 입증했다.
  • 제거 분석 결과, 적응형 특징 샘플링 전략(AFS)이 세 데이터셋 모두에서 일관되게 성능 향상을 이룬다.
  • 최적의 시간 범위 크기는 데이터셋에 따라 달라진다: TVSeries는 K=9, THUMOS-14는 K=7, HDD는 K=3로, 행동 템포의 차이를 반영한다.
  • 모델는 미래 행동 예측에서도 경쟁력 있는 성능을 보였으며, THUMOS-14에서는 44.0% mAP, TVSeries에서는 78.8% mcAP를 기록하여 강력한 특징 표현 학습 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.