Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Localize Actions from Moments

Fuchen Long, Ting Yao|arXiv (Cornell University)|2020. 08. 31.
Human Pose and Action Recognition참고 문헌 51인용 수 4
한 줄 요약

이 논문은 대규모 카테고리(예: Kinetics-600)의 트리밍된 액션 모멘트와 소규모 클래스에서의 시간적 애너테이션(예: ActivityNet v1.3)만을 사용하여 대규모 액션 로컬라이제이션을 가능하게 하는 one-stage 액션 로컬라이제이션 프레임워크인 Action Herald Networks(AherNet)를 제안한다. 공유된 가중치 전이 함수와 적대적 맥락 생성을 활용함으로써, AherNet는 완전히 지도 학습된 방법을 능가하는 최신 기술 수준의 성능을 달성하며, 0.5 IoU 임계값에서 Kinetics-600에서 mAP 24.43%를 기록한다.

ABSTRACT

With the knowledge of action moments (i.e., trimmed video clips that each contains an action instance), humans could routinely localize an action temporally in an untrimmed video. Nevertheless, most practical methods still require all training videos to be labeled with temporal annotations (action category and temporal boundary) and develop the models in a fully-supervised manner, despite expensive labeling efforts and inapplicable to new categories. In this paper, we introduce a new design of transfer learning type to learn action localization for a large set of action categories, but only on action moments from the categories of interest and temporal annotations of untrimmed videos from a small set of action classes. Specifically, we present Action Herald Networks (AherNet) that integrate such design into an one-stage action localization framework. Technically, a weight transfer function is uniquely devised to build the transformation between classification of action moments or foreground video segments and action localization in synthetic contextual moments or untrimmed videos. The context of each moment is learnt through the adversarial mechanism to differentiate the generated features from those of background in untrimmed videos. Extensive experiments are conducted on the learning both across the splits of ActivityNet v1.3 and from THUMOS14 to ActivityNet v1.3. Our AherNet demonstrates the superiority even comparing to most fully-supervised action localization methods. More remarkably, we train AherNet to localize actions from 600 categories on the leverage of action moments in Kinetics-600 and temporal annotations from 200 classes in ActivityNet v1.3. Source code and data are available at \url{https://github.com/FuchenUSTC/AherNet}.

연구 동기 및 목표

  • 모든 카테고리에 대해 완전한 시간적 애너테이션을 요구하지 않고 수천 개의 카테고리에 대한 액션 로컬라이제이션을 가능하게 하기 위해.
  • 트리밍된 모멘트에서의 액션 인식과 비트리밍 비디오에서의 액션 로컬라이제이션 간 격차를 전이 학습 기반으로 해소하기 위해.
  • 학습 중에 액션 모멘트의 실제 배경 맥락을 시뮬레이션하는 과제를 해결하기 위해.
  • annotation 비용을 줄이면서도 높은 로컬라이제이션 정확도를 유지하는 확장 가능한 부분 지도 학습 프레임워크를 개발하기 위해.
  • 소규모 애너테이션 클래스에서 최소한의 지도 신호만을 사용하여 하나의 모델로 대규모 액션 로컬라이제이션을 훈련시키는 것이 가능한지 입증하기 위해.

제안 방법

  • AherNet는 분류와 로컬라이제이션 작업 간 가중치 전이를 통합한 one-stage 액션 로컬라이제이션 프레임워크를 사용한다.
  • 공유된 가중치 전이 함수는 정면 세그먼트 분류에서 비트리밍 비디오의 시간적 액션 분류로 네트워크 파라미터를 매핑한다.
  • 적대적 학습을 통해 액션 모멘트의 실제적인 배경 특징을 생성하여, 실제 비트리밍 비디오 배경과 구분되도록 한다.
  • 제안 손실, 분류 손실, 적대적 손실을 사용하여 엔드 투 엔드로 훈련함으로써 로컬라이제이션과 맥락의 현실성 최적화를 달성한다.
  • 액션 모멘트는 합성 맥락으로 간주되어, 완전한 시간적 애너테이션 없이도 로컬라이제이션 모델링이 가능하다.
  • 프레임워크는 ActivityNet v1.3의 다양한 분할과 THUMOS14에서 ActivityNet v1.3로까지 적용되며, 600개 클래스를 가진 Kinetics-600으로 확장된다.

실험 결과

연구 질문

  • RQ1대규모 카테고리의 트리밍된 액션 모멘트와 소규모 클래스의 시간적 애너테이션만을 사용하여 액션 로컬라이제이션을 효과적으로 훈련시킬 수 있는가?
  • RQ2가중치 전이 함수는 어떻게 액션 모멘트에서의 분류와 비트리밍 비디오에서의 로컬라이제이션을 효과적으로 연결할 수 있는가?
  • RQ3적대적 학습을 통해 액션 모멘트 훈련을 위해 실제 비트리밍 비디오 배경을 모방하는 현실적인 배경 특징을 생성할 수 있는가?
  • RQ4부분 지도 학습 모델은 완전한 지도 신호 없이 대규모 액션 카테고리에 얼마나 잘 일반화되는가?
  • RQ5제안된 방법은 제로샷 또는 희소한 샘플 설정에서 완전히 지도 학습 및 약한 지도 학습 기반 모델을 초월하는가?

주요 결과

  • AherNet는 0.5 IoU 임계값에서 Kinetics-600에서 mAP 24.43%를 기록하며, 기준 모델의 14.18%에서 상당한 향상을 이룬다.
  • IoU 임계값이 0.5와 0.75일 때 각각 최근의 약한 지도 학습 방법보다 3.9%와 5.8% 높은 성능을 기록한다.
  • 모든 카테고리에 대해 완전한 시간적 애너테이션을 요구하는 여러 완전 지도 학습 모델을 뛰어넘는다.
  • 적대적 맥락 생성 모듈은 ANet-AM 및 ANet-FG 세트 양쪽에서 실제 배경 특징과 구별되지 않는 배경 특징을 생성한다.
  • AherNet ∗(완전 지도 학습 변형)은 시간적 애너테이션의 50% 이상을 사용할 때에만 AherNet를 초월하는 성능을 보이며, 부분 지도 학습 설계의 효율성을 확인한다.
  • Kinetics-600에서의 정성적 결과는 정확한 시간 경계 예측과 효과적인 액션 다이내믹스 모델링을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.