Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Zero-Shot Learning for Action Recognition with Web-Scale Video Data

Kun Liu, Wu Liu|arXiv (Cornell University)|2017. 10. 20.
Human Pose and Action Recognition참고 문헌 34인용 수 4
한 줄 요약

이 논문은 웹 스케일 비디오 데이터를 활용하여 정의되지 않은 동작을 훈련 예제 없이 인식할 수 있도록 의미 임베딩과 시각적 특징 전이를 이용한 감시 영상에서의 행동 인식을 위한 일반화된 제로샷 학습(GZSL) 프레임워크를 제안한다. 기존의 제로샷 학습 방법이 GZSL 설정에서 실패함을 입증하고, 새로 구축한 감시 영상 데이터셋에서 뛰어난 성능을 달성하는 새로운 방법을 도입하여 현실적인 조건에서 본래의 클래스와 본 적 없는 클래스를 구분하는 데 있어 이전 방법들을 능가한다.

ABSTRACT

Action recognition in surveillance video makes our life safer by detecting the criminal events or predicting violent emergencies. However, efficient action recognition is not free of difficulty. First, there are so many action classes in daily life that we cannot pre-define all possible action classes beforehand. Moreover, it is very hard to collect real-word videos for certain particular actions such as steal and street fight due to legal restrictions and privacy protection. These challenges make existing data-driven recognition methods insufficient to attain desired performance. Zero-shot learning is potential to be applied to solve these issues since it can perform classification without positive example. Nevertheless, current zero-shot learning algorithms have been studied under the unreasonable setting where seen classes are absent during the testing phase. Motivated by this, we study the task of action recognition in surveillance video under a more realistic \emph{generalized zero-shot setting}, where testing data contains both seen and unseen classes. To our best knowledge, this is the first work to study video action recognition under the generalized zero-shot setting. We firstly perform extensive empirical studies on several existing zero-shot leaning approaches under this new setting on a web-scale video data. Our experimental results demonstrate that, under the generalize setting, typical zero-shot learning methods are no longer effective for the dataset we applied. Then, we propose a method for action recognition by deploying generalized zero-shot learning, which transfers the knowledge of web video to detect the anomalous actions in surveillance videos. To verify the effectiveness of our proposed method, we further construct a new surveillance video dataset consisting of nine action classes related to the public safety situation.

연구 동기 및 목표

  • 제한된 레이블링 데이터와 프라이버시 제약으로 인해 드문 동작이나 본 적 없는 동작을 인식하는 데 도전한다.
  • 기존 ZSL보다 더 현실적인 일반화된 제로샷 학습(GZSL) 설정에서 영상 행동 인식을 연구한다. 여기서 테스트 시 본 적 있는 클래스와 본 적 없는 클래스가 모두 존재한다.
  • 기존의 제로샷 학습 방법이 영상 인식의 GZSL 설정에 적용되었을 때의 한계를 규명한다. 특히 본 적 없는 동작을 본 적 있는 클래스로 잘못 분류하는 경향을 분석한다.
  • 공공 안전 관련 행동 클래스 9종을 포함한 새로운 청소년 감시 영상 데이터셋을 구축하여 제안된 방법을 검증한다.
  • 웹 스케일 영상에서의 지식 전이를 통해 감시 환경에서 이질적인 행동을 탐지할 수 있는 강력한 GZSL 프레임워크를 개발한다.

제안 방법

  • 테스트 시 본 적 있는 클래스와 본 적 없는 클래스가 모두 존재하는 일반화된 제로샷 학습(GZSL) 패러다임을 채택하여 실제 운영 환경을 시뮬레이션한다.
  • 시공간적 외형과 시간적 동적 특징을 옵티컬 플로우를 통해 캡처하는 이중 스트림 CNN을 사용하여 웹 스케일 비디오 데이터를 활용해 시각적 표현을 사전 학습한다.
  • 행동 클래스를 표현하기 위해 의미 임베딩(예: 워드 벡터 또는 속성)을 활용하여 본 적 없는 카테고리로의 제로샷 전이를 가능하게 한다.
  • 시각적 특징을 의미 공간으로 매핑하는 통합 분류기를 학습하여 본 적 있는 클래스와 본 적 없는 클래스를 동시에 구분하도록 학습한다.
  • 본 적 있는 클래스와 본 적 없는 클래스에서의 성능를 균형 잡는 손실 함수를 도입하여 추론 시 본 적 있는 클래스에 대한 편향을 줄인다.
  • 학습 분포에 과적합되지 않도록 별도의 검증 세트에서 초모델 튜닝을 수행하여 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1기존의 제로샷 학습 방법은 본 적 있는 클래스와 본 적 없는 클래스가 모두 테스트 시 존재하는 일반화된 제로샷 학습(GZSL) 설정에서 어떻게 성능을 발휘하는가?
  • RQ2왜 기존의 제로샷 학습 방법은 감시 시나리오에서 영상 행동 인식의 GZSL 설정에서 실패하는가?
  • RQ3웹 스케일 데이터를 활용하여 감시 영상에서 본 적 있는 동작과 본 적 없는 동작을 동시에 인식할 수 있는 통합 프레임워크를 설계할 수 있는가?
  • RQ4시각적 공간과 의미 공간 사이의 의미 갭이 행동 인식의 GZSL에서 어떤 역할을 하는가? 그리고 이를 어떻게 최소화할 수 있는가?
  • RQ5제안된 방법은 감시 영상에서 본 적 없는 동작에 대한 정확도와 일반화 능력 측면에서 최신의 ZSL 접근법과 비교하여 어떻게 성능를 발휘하는가?

주요 결과

  • 기존의 제로샷 학습 방법은 일반화된 제로샷 학습(GZSL) 설정에서 본 적 없는 클래스에서 성능가 매우 떨어지며, 대부분의 본 적 없는 샘플이 본 적 있는 클래스로 잘못 분류된다.
  • 표준 다중 클래스 분류의 성능는 어떤 제로샷 설정보다도 일관되게 높게 유지되며, 이는 제로샷 인식이 여전히 도전적인 문제임을 확인한다.
  • 시험된 방법들 중에서 SynCstruct가 기존 ZSL 설정과 GZSL 설정 모두에서 가장 뛰어난 성능를 보이며, 이는 GZSL 적응에 대한 강건성과 잠재력을 시사한다.
  • 제안된 방법은 본 적 있는 클래스와 본 적 없는 클래스에서의 분류 성능를 균형 잡음으로써 일반화 능력을 크게 향상시키며, 본 적 있는 클래스에 대한 편향을 줄인다.
  • 감시 영상에서의 행동 인식은 웹 영상보다 본질적으로 더 어렵다. 어두운 조명, 운동 블러, 작은 객체 크기, 盗취와 같은 짧고 복잡한 행동 등이 원인이다.
  • 공공 안전 관련 행동 클래스 9종을 포함한 새로 구축한 감시 영상 데이터셋은 실제 운영 환경에서 GZSL를 평가하기 위한 현실적인 벤치마크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.