Skip to main content
QUICK REVIEW

[논문 리뷰] Spotting Macro- and Micro-expression Intervals in Long Video Sequences

Ying He, Sujing Wang|arXiv (Cornell University)|2019. 12. 18.
Gaze Tracking and Assistive Technology참고 문헌 27인용 수 5
한 줄 요약

이 논문은 장시간 영상 시퀀스에서 매크로 및 마이크로 표현을 탐지하기 위한 베이스라인 방법을 제시한다. 주요 방향 최대 차이 분석(MDMD)을 사용하여 광학 흐름의 차이를 통해 얼굴 운동을 탐지하고, 단일 프레임 예측을 시간 간격으로 후처리한다. CAS(ME)²에서 매크로 표현에 대해 F1 점수 0.1196, 마이크로 표현에 대해 0.0082를 기록했고, SAMM Long Videos에서는 매크로 표현에 대해 0.0629, 마이크로 표현에 대해 0.0364를 기록하여 높은 가짜 양성 비율에도 불구하고 초도 가능성은 입증하였다.

ABSTRACT

This paper presents baseline results for the Third Facial Micro-Expression Grand Challenge (MEGC 2020). Both macro- and micro-expression intervals in CAS(ME)$^2$ and SAMM Long Videos are spotted by employing the method of Main Directional Maximal Difference Analysis (MDMD). The MDMD method uses the magnitude maximal difference in the main direction of optical flow features to spot facial movements. The single-frame prediction results of the original MDMD method are post-processed into reasonable video intervals. The metric F1-scores of baseline results are evaluated: for CAS(ME)$^2$, the F1-scores are 0.1196 and 0.0082 for macro- and micro-expressions respectively, and the overall F1-score is 0.0376; for SAMM Long Videos, the F1-scores are 0.0629 and 0.0364 for macro- and micro-expressions respectively, and the overall F1-score is 0.0445. The baseline project codes are publicly available at https://github.com/HeyingGithub/Baseline-project-for-MEGC2020_spotting.

연구 동기 및 목표

  • 장시간 영상 시퀀스에서 매크로 및 마이크로 표현을 동시에 탐지하는 데 도전하는 문제를 다루며, 이는 일반적으로 개별적으로 간과되는 경향이 있다.
  • 제3회 얼굴 마이크로 표현 대회(MEGC 2020)를 위한 베이스라인 솔루션을 제공하며, 프레임 수준의 분류가 아니라 간격 탐지에 초점을 맞춘다.
  • 실제 표현 지속 시간과 더 잘 일치하기 위해 단일 프레임 예측을 일관된 시간 간격으로 후처리함으로써 원래의 MDMD 방법을 개선한다.
  • 약자(annotation)의 정확도 부족에 대비하여 간격 수준의 F1 점수를 0.5 IoU 임계값으로 평가하여 성능의 견고성을 확보한다.
  • 두 가지 기준 데이터셋인 CAS(ME)²와 SAMM Long Videos에서 평가 지표와 진짜값 정의를 표준화함으로써 다양한 방법 간의 공정한 비교를 가능하게 한다.

제안 방법

  • 연속 프레임 간 광학 흐름 특징의 주요 방향에서 최대 차이의 크기를 계산하기 위해 주요 방향 최대 차이 분석(MDMD)을 적용한다.
  • MDMD 점수를 프레임 수준의 얼굴 운동 강도 지표로 사용하며, 높은 값은 표현 시작 가능성을 시사한다.
  • 이웃한 프레임이 운동으로 예측된 경우 이를 연속적인 간격으로 묶어 단일 프레임 예측을 후처리한다.
  • 가짜로 짧거나 긴 간격을 제거하기 위해 최소 및 최대 길이 임계값을 기반으로 간격을 필터링한다: CAS(ME)²에는 16 프레임, SAMM Long Videos에는 105 프레임을 사용한다.
  • MDMD 예측의 민감도를 제어하기 위해 임계값 파라미터 $ p $ 를 조정하며, 최적의 기본 설정으로 $ p = 0.01 $ 을 선택하였다.
  • 예측된 간격과 진짜값 간의 교차율(IoU)이 0.5 이상이 되는 조건을 통해 참 긍정(true positives)을 정의하여 인간 약자로 표시된 표현 창과의 일치를 확보한다.

실험 결과

연구 질문

  • RQ1MDMD 방법은 사전에 분할된 데이터에 의존하지 않고 장시간 영상 시퀀스에서 매크로 및 마이크로 표현 간격을 효과적으로 탐지할 수 있는가?
  • RQ2MDMD의 임계값 $ p $ 를 다양하게 조정할 경우, 다양한 데이터셋에서 정밀도와 재현도의 균형에 어떤 영향을 미치는가?
  • RQ3단일 프레임 예측을 간격으로 후처리하는 것이 시간적으로 일관된 얼굴 운동 탐지에 얼마나 기여하는가?
  • RQ4현재의 베이스라인 방법과 최신 기술 간의 성능 격차는 무엇인가? 장시간 영상에서 매크로 및 마이크로 표현을 동시에 탐지하는 데서.
  • RQ5해상도, 프레임 레이트, 표현 지속 시간의 차이가 있는 CAS(ME)²와 SAMM Long Videos 간의 베이스라인 방법의 F1 점수는 어떻게 비교되는가?

주요 결과

  • 베이스라인 방법은 CAS(ME)² 데이터셋에서 매크로 표현 탐지에 대해 F1 점수 0.1196, 마이크로 표현 탐지에 대해 0.0082를 기록하였다.
  • SAMM Long Videos 데이터셋에서는 매크로 표현에 대해 F1 점수 0.0629, 마이크로 표현에 대해 0.0364를 기록하여 매크로 표현 탐지 비율이 더 높음을 시사하였다.
  • 전반적인 F1 점수는 CAS(ME)²에서 0.0376, SAMM Long Videos에서 0.0445였으며, 높은 가짜 양성 비율로 인해 전체 성능이 낮았다.
  • $ p $ 가 증가함에 따라 참 긍정 수가 감소했고, CAS(ME)²에서는 F1 점수가 처음에는 증가하다가 감소하는 경향을 보였으며, $ p = 0.12 $ 근처에서 최고점을 기록하였다. 그러나 최종 베이스라인 결과의 경우 가장 낮은 $ p $ 값인 $ p = 0.01 $ 을 선택하였다.
  • 두 데이터셋에서 정밀도는 낮게 유지되었다—CAS(ME)²에서 매크로 표현에 대해 0.0716, 마이크로 표현에 대해 0.0042로, 가짜 양성 수가 많음을 시사한다.
  • SAMM Long Videos에서 마이크로 표현의 재현도는 0.1824로 CAS(ME)²의 0.3684보다 상대적으로 낮았지만, 낮은 F1 점수에도 불구하고 이 데이터셋에서 마이크로 표현 탐지 성능이 더 우수한 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.