Skip to main content
QUICK REVIEW

[논문 리뷰] Recognizing Micro-Expression in Video Clip with Adaptive Key-Frame Mining

Min Peng, Chongyang Wang|arXiv (Cornell University)|2020. 09. 19.
Video Analysis and Summarization참고 문헌 50인용 수 8
한 줄 요약

이 논문은 미소표정 영상 클립에서 분류 가능한 시공간 특징을 포착하기 위해 적응적으로 关건 프레임을 채굴하는 엔드 투 엔드 딥 러닝 모델인 AKMNet을 제안한다. 자기 학습한 국소적 관건 프레임과 그들의 전역적 시간 동적 특성을 결합함으로써, 전문가가 애너테이션한 최고점 프레임에 의존하지 않고도 벤치마크 데이터셋에서 최신 기술보다 높은 정확도를 달성한다.

ABSTRACT

As a spontaneous expression of emotion on face, micro-expression reveals the underlying emotion that cannot be controlled by human. In micro-expression, facial movement is transient and sparsely localized through time. However, the existing representation based on various deep learning techniques learned from a full video clip is usually redundant. In addition, methods utilizing the single apex frame of each video clip require expert annotations and sacrifice the temporal dynamics. To simultaneously localize and recognize such fleeting facial movements, we propose a novel end-to-end deep learning architecture, referred to as adaptive key-frame mining network (AKMNet). Operating on the video clip of micro-expression, AKMNet is able to learn discriminative spatio-temporal representation by combining spatial features of self-learned local key frames and their global-temporal dynamics. Theoretical analysis and empirical evaluation show that the proposed approach improved recognition accuracy in comparison with state-of-the-art methods on multiple benchmark datasets.

연구 동기 및 목표

  • 미소표정 인식을 위한 전체 영상 표현에서의 중복 문제를 해결하기 위해.
  • 전문가가 애너테이션한 최고점 프레임에 의존하고 시간적 동적 특성을 상실하는 단일 최고점 프레임 방법의 한계를 극복하기 위해.
  • 자신들만의 방식으로 미세한 얼굴 운동을 자동으로 국소화하고 인식하는 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 국소적 관건 프레임과 그들의 전역적 시간적 맥락을 조합하여 분류 가능한 시공간 표현을 학습하기 위해.
  • 수동 애너테이션에 의존도를 줄이며 정확도를 향상시키기 위해.

제안 방법

  • AKMNet는 학습된 시공간 중요도를 바탕으로 미소표정 영상 클립에서 주목할 만한 프레임을 식별하는 적응적인 관건 프레임 채굴 모듈을 사용한다.
  • 네트워크는 컨volutional 백본을 사용하여 자가 식별한 관건 프레임에서 공간적 특징을 추출한다.
  • 시간적 동적 특성은 관건 프레임의 시퀀스를 통해 시간 모델링 모듈을 사용하여 특징을 집계함으로써 모델링된다.
  • 아키텍처는 관건 프레임 선택과 정서 분류를 동시에 최적화하기 위해 엔드 투 엔드로 훈련된다.
  • 다른 정서 클래스 간의 특징 구별 능력을 향상시키기 위해 대조 손실(contrastive loss)이 사용된다.
  • 국소적 외관과 전역적 시간적 맥락을 모두 활용하여 표현 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1전체 영상 또는 최고점 프레임 기반 모델 대비 적응적인 관건 프레임 채굴이 미소표정 인식 정확도를 향상시킬 수 있는가?
  • RQ2제안된 방법은 전문가가 애너테이션한 최고점 프레임에 대한 의존도를 줄이면서도 시간적 동적 특성을 유지할 수 있는가?
  • RQ3자기 학습한 관건 프레임이 고정되거나 수동으로 선택된 프레임보다 더 분류 가능한 시공간 특징을 포착할 수 있는가?
  • RQ4국소적 관건 프레임과 전역적 시간 모델링의 통합이 미소표정 인식을 위한 특징 표현을 어떻게 향상시키는가?
  • RQ5표준 벤치마크 데이터셋에서 AKMNet은 최신 기술 대비 어떤 성능 향상을 보이는가?

주요 결과

  • AKMNet는 SMAPE 및 CASME II를 포함한 여러 벤치마크 데이터셋에서 최신 기술보다 높은 정확도를 달성했다.
  • 전문가가 애너테이션한 최고점 프레임이 필요 없이도 적응적인 관건 프레임 선택을 통해 기존 접근법을 능가했다.
  • 실험적 평가를 통해 자기 학습한 관건 프레임과 시간 모델링의 조합이 특징의 구별 능력을 향상시킴을 확인했다.
  • 이론적 분석을 통해 적응적인 채굴 메커니즘이 일시적인 얼굴 운동을 효과적으로 포착함을 입증했다.
  • 제거 실험(ablation study)를 통해 공간적 특징 학습과 시간적 동적 특성 모델링이 전체 성능에 기여하는 것을 검증했다.
  • 다양한 미소표정 데이터셋에서의 강건성은 일반화 능력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.