Skip to main content
QUICK REVIEW

[논문 리뷰] Localizing Actions from Video Labels and Pseudo-Annotations

Pascal Mettes, Cees G. M. Snoek|arXiv (Cornell University)|2017. 07. 28.
Human Pose and Action Recognition참고 문헌 26인용 수 10
한 줄 요약

이 논문은 영상의 클래스 레이블과 자동으로 생성된 허위 앵커(annotation)만을 사용하여 행동을 국소화하는 약한 감독 행동 국소화 방법을 제안한다. 이는 비용이 많이 드는 상자 또는 점 앵커(annotation)가 필요 없도록 한다. 다섯 가지 시각적 신호(사람 검출, 운동, 행동 제안, 물체 제안, 중심 편향)와 상관관계 기반 메트릭을 활용하여 이를 선택하고 조합함으로써, UCF Sports, UCF-101, Hollywood2Tubes 데이터셋에서 완전한 상자 감독 성능과 비교할 만한 성능을 달성한다.

ABSTRACT

The goal of this paper is to determine the spatio-temporal location of actions in video. Where training from hard to obtain box annotations is the norm, we propose an intuitive and effective algorithm that localizes actions from their class label only. We are inspired by recent work showing that unsupervised action proposals selected with human point-supervision perform as well as using expensive box annotations. Rather than asking users to provide point supervision, we propose fully automatic visual cues that replace manual point annotations. We call the cues pseudo-annotations, introduce five of them, and propose a correlation metric for automatically selecting and combining them. Thorough evaluation on challenging action localization datasets shows that we reach results comparable to results with full box supervision. We also show that pseudo-annotations can be leveraged during testing to improve weakly- and strongly-supervised localizers.

연구 동기 및 목표

  • 영상 행동 국소화에서 고비용의 시공간 상자 또는 점 앵커(annotation)가 필요 없도록 하는 것.
  • 영상 클래스 레이블과 시각적 신호를 허위 앵커(annotation)로만 사용하는 완전 자동화된 방법을 개발하는 것.
  • 정보가 풍부한 허위 앵커(annotation)를 자동으로 선택하고 조합하여 약한 감독 국소화 성능을 향상시키는 것.
  • 허위 앵커(annotation)가 학습 기간뿐만 아니라 추론 기간 동안에도 성능 향상에 기여할 수 있음을 보여주는 것.
  • 수동 경계 상자 앵커(annotation)가 필요 없이 어떤 행동 분류 데이터셋이라도 행동 국소화를 수행할 수 있도록 하는 것.

제안 방법

  • 사람 검출, 독립적 운동, 행동 제안, 물체 제안, 중심 편향 등 다섯 가지 유형의 허위 앵커(annotation)를 시각적 신호에서 유도한다.
  • 각 행동에 대해 가장 정보가 풍부한 허위 앵커(annotation)를 자동으로 선택하고 조합하기 위한 상관관계 기반 메트릭을 제안한다.
  • 다중 예외 학습(MIL)을 사용하여, 허위 앵커(annotation)와 영상 레이블을 기반으로 비감독 행동 제안을 통해 행동 국소화 모델을 훈련시킨다.
  • 동일한 허위 앵커(annotation)를 추론 단계에 적용하여 국소화 결과를 개선하고, 다양한 모델에서 성능 향상을 이룬다.
  • 초음소 및 운동 신호를 활용한 비감독 행동 제안(예: 슈퍼바올, 운동 신호)을 국소화를 위한 후보 튜브로 사용한다.
  • 허위 앵커(annotation)와 진짜 행동 위치 간의 상관관계를 활용하여 훈련 및 테스트 단계에서 고품질의 신호를 우선순위로 정렬한다.

실험 결과

연구 질문

  • RQ1수동 상자 또는 점 감독 없이 영상 클래스 레이블과 자동으로 생성된 허위 앵커(annotation)만으로도 효과적으로 행동 국소화를 수행할 수 있는가?
  • RQ2운동, 물체 제안, 사람 검출 등의 시각적 신호 중에서 약한 감독 환경에서 행동 국소화를 안내하는 데 가장 유용한 것은 무엇인가?
  • RQ3다양한 허위 앵커(annotation)를 자동으로 선택하고 조합하여 국소화 성능을 향상시킬 수 있는가?
  • RQ4허위 앵커(annotation)가 학습 기간뿐만 아니라, 전체 상자 감독으로 훈련된 모델의 추론 단계에서도 정확도 향상에 기여할 수 있는가?
  • RQ5허위 앵커(annotation)는 약한 감독과 완전한 감독 사이의 성능 격차를 어느 정도 줄일 수 있는가?

주요 결과

  • 제안된 방법은 UCF Sports 및 UCF-101에서 각각 AUC 53.3%와 mAP 35.1%를 달성하여 동일한 설정에서 완전한 상자 감독 성능과 동일한 성능을 보였다.
  • 테스트 단계에서 허위 앵커(annotation)를 사용할 경우, UCF Sports 및 UCF-101에서 AUC 55.6%와 mAP 37.4%로 성능이 향상되어 이 데이터셋에서 완전한 상자 감독 결과를 초월하는 성능을 달성했다.
  • Hollywood2Tubes 데이터셋에서는 영상 레이블과 허위 앵커(annotation)만으로도 13.6% mAP를 달성하여 이전의 약한 감독 방법보다 유의미하게 뛰어난 성능을 보였다.
  • 상관관계 기반의 허위 앵커(annotation) 선택은 모든 데이터셋에서 일관된 성능 향상을 이끌어내어 이 메트릭의 효과성을 입증했다.
  • 완전한 상자 감독으로 훈련된 모델에 적용해도 허위 앵커(annotation)가 국소화 정확도를 향상시키며, 이는 그 일반화 가능성과 강건성을 시사한다.
  • 이 방법은 수동 앵커(annotation)가 필요 없이 대규모 데이터셋인 Sports 1M, ActivityNet, EventNet에서도 행동 국소화를 수행할 수 있도록 하여, 약한 감독 환경에 대한 적용 가능성을 넓혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.