Skip to main content
QUICK REVIEW

[논문 리뷰] Out-of-Distribution Detection for Generalized Zero-Shot Action Recognition

Devraj Mandal, Sanath Narayan|arXiv (Cornell University)|2019. 04. 18.
Human Pose and Action Recognition참고 문헌 31인용 수 8
한 줄 요약

이 논문은 일반화된 제로샷 동작 인식(GZSL)을 위한 새로운 외부 분포(OD) 검출기인 CEWGAN-OD를 제안한다. 이 검출기는 본래의 편향을 줄이기 위해 본 적 있는 동작 카테고리와 본 적 없는 동작 카테고리 간의 분류를 분리한다. 본 논문은 조건부 워셔스타인 GAN(CEWGAN)을 사용해 본 적 없는 동작 특징을 합성하고, 이에 대해 코사인 및 사이클 일致성 손실을 적용함으로써 특징의 다양성과 품질을 향상시킨다. 이 검출기는 본 적 없는 특징을 식별하기 위해 엔트로피 최대화 기법을 사용하며, 이를 통해 본 적 없는 특징를 전용 본 적 없는 분류기로 라우팅한다. 이로 인해 올림픽 스포츠, HMDB51, UCF101 데이터셋에서 각각 7.0%, 3.4%, 4.9%의 절대 정확도 향상을 달성하여 최신 기술(SOTA)을 달성한다.

ABSTRACT

Generalized zero-shot action recognition is a challenging problem, where the task is to recognize new action categories that are unavailable during the training stage, in addition to the seen action categories. Existing approaches suffer from the inherent bias of the learned classifier towards the seen action categories. As a consequence, unseen category samples are incorrectly classified as belonging to one of the seen action categories. In this paper, we set out to tackle this issue by arguing for a separate treatment of seen and unseen action categories in generalized zero-shot action recognition. We introduce an out-of-distribution detector that determines whether the video features belong to a seen or unseen action category. To train our out-of-distribution detector, video features for unseen action categories are synthesized using generative adversarial networks trained on seen action category features. To the best of our knowledge, we are the first to propose an out-of-distribution detector based GZSL framework for action recognition in videos. Experiments are performed on three action recognition datasets: Olympic Sports, HMDB51 and UCF101. For generalized zero-shot action recognition, our proposed approach outperforms the baseline (f-CLSWGAN) with absolute gains (in classification accuracy) of 7.0%, 3.4%, and 4.9%, respectively, on these datasets.

연구 동기 및 목표

  • GZSL 모델에서 본 적 있는 동작 카테고리에 대한 본래의 편향을 해결하기 위해 본 적 있는 카테고리와 본 적 없는 카테고리 간의 분류를 분리한다.
  • 실제로 본 적 없는 특징가 없을 경우, 전용 외부 분포(OD) 검출기를 도입하여 본 적 없는 동작 샘플이 본 적 있는 카테고리로 잘못 분류되는 것을 줄인다.
  • 실제 본 적 없는 특징가 없을 경우, 조건부 GAN을 통해 이를 합성함으로써 OD 검출기의 효과적인 훈련을 가능하게 한다.
  • OD 검출 결과에 따라 본 적 있는 분류기 또는 본 적 없는 분류기로 특징를 동적으로 라우팅함으로써 GZSL 성능을 향상시킨다.
  • 다양한 속성 가용성과 비디오 특징 유형을 가진 여러 데이터셋에서 이 프레임워크의 효과성을 입증한다.

제안 방법

  • OD 검출기는 본 적 있는 동작 카테고리의 실제 특징와 본 적 없는 카테고리의 GAN 생성 특징를 사용해 훈련한다.
  • 조건부 워셔스타인 GAN(CEWGAN)을 사용해 본 적 없는 동작 특징를 합성하며, 이는 카테고리 임베딩(속성)에 조건을 두어 의미적 일致성을 확보한다.
  • CEWGAN는 특징의 다양성과 품질을 향상시키기 위해 코사인 임베딩 손실 및 사이클 일치 손실을 추가로 최적화한다.
  • OD 검출기는 본 적 없는 특징의 출력 엔트로피를 최대화함으로써 본 적 있는 카테고리에 대해 피크가 있는 비균일 분포와 본 적 없는 카테고리에 대해 균일한 분포를 생성한다.
  • 추론 시, OD 검출기의 출력 엔트로피를 임계값과 비교하여 특징를 본 적 있는 분류기 또는 본 적 없는 분류기로 라우팅한다.
  • 최종 예측은 검출된 분포 유형(본 적 있는지 본 적 없는지)에 해당하는 분류기에 의해 이루어진다.

실험 결과

연구 질문

  • RQ1GZSL 비디오 인식에서, 외부 분포 검출기가 본 적 있는 카테고리와 본 적 없는 카테고리 간에 효과적으로 구분할 수 있는가?
  • RQ2실제 본 적 없는 특징가 없을 경우, 어떻게 효과적으로 본 적 없는 동작 특징를 합성하여 OD 검출기의 훈련을 할 수 있는가?
  • RQ3본 적 있는 카테고리에 대한 본래의 편향을 줄이기 위해 본 적 있는 카테고리와 본 적 없는 카테고리의 분류 경로를 분리하는 것이 효과적인가?
  • RQ4코사인 및 사이클 일치성과 같은 추가 정규화를 적용한 합성 특징를 사용할 경우, OD 검출 성능이 얼마나 향상되는가?
  • RQ5제안된 프레임워크는 수동으로 주어진 속성이 있는가 없는가에 관계없이 다양한 데이터셋에 일반화 가능한가?

주요 결과

  • 제안된 CEWGAN-OD 프레임워크는 올림픽 스포츠 데이터셋에서 베이스라인 대비 7.0%의 절대 정확도 향상을 달성한다.
  • HMDB51에서는 단어 임베딩(word2vec)을 사용한 베이스라인 대비 3.4%의 GZSL 정확도 향상을 기록한다.
  • UCF101에서는 베이스라인 대비 4.9%의 절대 정확도 향상을 달성한다.
  • HMDB51에서 단어 임베딩(word2vec)을 그대로 사용하는 것보다, 전이된 수동 속성(단어 임베딩에서 학습한)을 사용해 특징를 합성할 경우 더 높은 성능을 기록한다.
  • 모든 데이터셋에서 I3D 외관+흐름(I3D af) 특징가 가장 뛰어난 성능을 보이며, C3D 및 I3D 단독 버전을 모두 초월한다.
  • OD 검출기의 엔트로피 기반 라우팅 메커니즘이, 특히 고정확도 설정에서 본 적 없는 동작이 본 적 있는 동작로 잘못 분류되는 것을 효과적으로 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.