Skip to main content
QUICK REVIEW

[논문 리뷰] SLAC: A Sparsely Labeled Dataset for Action Classification and Localization

Hang Zhao, Zhicheng Yan|arXiv (Cornell University)|2017. 12. 26.
Human Pose and Action Recognition인용 수 22
한 줄 요약

이 논문은 520만 개의 트림되지 않은 영상과 200개의 동작 클래스에 걸쳐 175만 개의 희박한 클립 레이블을 포함하는 대규모 비디오 데이터셋인 SLAC을 소개한다. 이 데이터셋은 인간 레이블러의 작업 시간을 95% 감소시키는 가용성 있는 프레임워크를 통해 구축되었으며, 어려운, 모호한 클립에만 집중함으로써 레이블링 효율성을 극대화한다. SLAC에서 사전 훈련을 수행하면 HMDB-51에서 행동 인식 정확도가 최대 35.4% 향상되고, THUMOS14에서 행동 로컬라이제이션 mAP가 8.6% 향상된다.

ABSTRACT

This paper describes a procedure for the creation of large-scale video datasets for action classification and localization from unconstrained, realistic web data. The scalability of the proposed procedure is demonstrated by building a novel video benchmark, named SLAC (Sparsely Labeled ACtions), consisting of over 520K untrimmed videos and 1.75M clip annotations spanning 200 action categories. Using our proposed framework, annotating a clip takes merely 8.8 seconds on average. This represents a saving in labeling time of over 95% compared to the traditional procedure of manual trimming and localization of actions. Our approach dramatically reduces the amount of human labeling by automatically identifying hard clips, i.e., clips that contain coherent actions but lead to prediction disagreement between action classifiers. A human annotator can disambiguate whether such a clip truly contains the hypothesized action in a handful of seconds, thus generating labels for highly informative samples at little cost. We show that our large-scale dataset can be used to effectively pre-train action recognition models, significantly improving final metrics on smaller-scale benchmarks after fine-tuning. On Kinetics, UCF-101 and HMDB-51, models pre-trained on SLAC outperform baselines trained from scratch, by 2.0%, 20.1% and 35.4% in top-1 accuracy, respectively when RGB input is used. Furthermore, we introduce a simple procedure that leverages the sparse labels in SLAC to pre-train action localization models. On THUMOS14 and ActivityNet-v1.3, our localization model improves the mAP of baseline model by 8.6% and 2.5%, respectively.

연구 동기 및 목표

  • 행동 인식 및 로컬라이제이션을 위한 대규모 비디오 데이터셋을 구축하는 데 있어 높은 비용과 확장성의 한계를 해결하기 위해.
  • 예측이 모호하고 분류가 어려운 클립에만 인간 레이블링을 우선시하여 인간 레이블링 노력의 감소를 도모하기 위해.
  • 웹 스케일의 제약 없는 비디오 데이터를 활용하여 확장 가능한 파이프라인을 개발하기 위해.
  • SLAC에서의 사전 훈련이 최종 행동 인식 및 로컬라이제이션 벤치마크 성능에 크게 기여함을 보여주기 위해.

제안 방법

  • 사전 훈련된 행동 분류기들을 사용하여 트림되지 않은 웹 영상에서 후보 클립을 자동으로 추출한다.
  • 여러 분류기 간의 예측 불일치를 유발하는 '어려운 클립'을 식별하여 인간 레이블링의 고위험 대상으로 삼는다.
  • 이러한 어려운 클립들만을 인간 레이블러가 레이블링하며, 평균 8.8초의 클립당 레이블링 시간으로 비용을 극도로 절감한다.
  • 결과적으로 생성된 희박한 레이블을 바탕으로 행동 인식 및 행동 로컬라이제이션 모델을 사전 훈련한다.
  • 희박한 클립 수준의 레이블을 약한 지도 학습 기반의 행동 로컬라이제이션에 적합하도록 단순한 절차로 변환한다.
  • 표준 벤치마크에서 사전 훈련된 모델을 미세조정하여 전이 성능를 평가한다.

실험 결과

연구 질문

  • RQ1확장 가능한 자동화된 파이프라인은 대규모 비디오 데이터셋 제작 시 레이블링 노력의 감소를 이끌 수 있을까, 동시에 레이블 품질은 유지할 수 있을까?
  • RQ2SLAC에서의 사전 훈련은 최종 벤치마크에서 행동 인식 성능 향상에 얼마나 효과적인가?
  • RQ3SLAC에서 유래한 희박한 레이블은 행동 로컬라이제이션 모델 훈련에 효과적으로 활용될 수 있는가?
  • RQ4어려운 클립에만 인간 레이블링을 집중시키는 전략이 무작위 또는 균일하게 샘플링된 레이블링 방식보다 더 높은 모델 성능을 낼 수 있는가?
  • RQ5SLAC는 표준 벤치마크에서 상위-1 정확도와 mAP 측면에서 어떤 성능 향상을 제공하는가?

주요 결과

  • RGB 입력을 사용할 경우, SLAC에서 사전 훈련하면 Kinetics에서 상위-1 정확도가 2.0% 향상되고, UCF-101에서 20.1% 향상되며, HMDB-51에서 35.4% 향상된다.
  • 제안된 레이블링 프레임워크는 클립당 평균 레이블링 시간을 8.8초로 줄여, 기존 수동 트림 및 로컬라이제이션 방식 대비 95% 이상의 절감 효과를 달성한다.
  • SLAC에서 사전 훈련된 행동 인식 모델은 평가된 모든 벤치마크에서 랜덤 초기화된 모델보다 뛰어난 성능을 보인다.
  • SLAC의 희박한 레이블 기반의 약한 지도 학습 로컬라이제이션 방법은 THUMOS14에서 mAP를 8.6% 향상시키고, ActivityNet-v1.3에서 2.5% 향상시킨다.
  • 이 프레임워크는 520만 개 이상의 트림되지 않은 영상과 200개의 행동 카테고리에 걸쳐 175만 개의 클립 레이블에까지 성공적으로 확장되었다.
  • 어려운 클립 우선 순위 정책을 통해 최소한의 인간 노력으로도 높은 정보량의 레이블을 확보할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.