Skip to main content
QUICK REVIEW

[논문 리뷰] SMA-STN: Segmented Movement-Attending Spatiotemporal Network forMicro-Expression Recognition

Jiateng Liu, Wenming Zheng|arXiv (Cornell University)|2020. 10. 19.
Human Pose and Action Recognition참고 문헌 30인용 수 7
한 줄 요약

이 논문은 미세표정 인식(MER)을 향상시키기 위해 동적 분할 희박 영상 모듈(DSSI)과 분할 이동 주의 모듈(STMA)을 갖춘 새로운 시공간 신경망인 SMA-STN을 제안한다. 이는 미세한 운동 변화를 포착하고 중요한 시간적 세그먼트를 강조함으로써 성능을 향상시킨다. 이 방법은 이질성 증강 손실(DE-Loss)을 통해 미세 수준의 운동 차이를 확대함으로써 기존 방법보다 뚜렷한 성능 향상을 이룬다. SMIC-HS 데이터셋에서 77.44%의 정확도와 0.7683의 F1 점수를 기록하여 최신 기술(SOTA) 수준을 달성한다.

ABSTRACT

Correctly perceiving micro-expression is difficult since micro-expression is an involuntary, repressed, and subtle facial expression, and efficiently revealing the subtle movement changes and capturing the significant segments in a micro-expression sequence is the key to micro-expression recognition (MER). To handle the crucial issue, in this paper, we firstly propose a dynamic segmented sparse imaging module (DSSI) to compute dynamic images as local-global spatiotemporal descriptors under a unique sampling protocol, which reveals the subtle movement changes visually in an efficient way. Secondly, a segmented movement-attending spatiotemporal network (SMA-STN) is proposed to further unveil imperceptible small movement changes, which utilizes a spatiotemporal movement-attending module (STMA) to capture long-distance spatial relation for facial expression and weigh temporal segments. Besides, a deviation enhancement loss (DE-Loss) is embedded in the SMA-STN to enhance the robustness of SMA-STN to subtle movement changes in feature level. Extensive experiments on three widely used benchmarks, i.e., CASME II, SAMM, and SHIC, show that the proposed SMA-STN achieves better MER performance than other state-of-the-art methods, which proves that the proposed method is effective to handle the challenging MER problem.

연구 동기 및 목표

  • 짧은 지속 시간, 낮은 강도, 높은 프레임 유사성으로 인해 미세표정을 인식하는 데 도전하는 문제를 해결하기 위해.
  • 유사한 인접 프레임 간의 중복을 줄이면서도 핵심 운동 정보를 유지하기 위해.
  • 장거리 공간적 종속성과 정보성 시간 세그먼트를 효과적으로 포착하는 강력한 딥 러닝 프레임워크를 개발하기 위해.
  • 새로운 손실 함수를 통해 미세 운동 변화에 대한 특징 수준의 강건성을 향상시키기 위해.

제안 방법

  • 유일한 프로토콜에 따라 미세표정 시퀀스에서 네 개의 서로 다른 세그먼트를 샘플링하고 동적 영상을 계산하여 시공간적 운동 패턴을 표현하는 동적 분할 희박 영상(DSSI) 모듈을 제안한다.
  • CNN 기반 백본과 시공간 이동 주의(STMA) 모듈을 갖춘 분할 이동 주의 시공간 네트워크(SMA-STN)를 도입하여 공간 영역과 시간 세그먼트 간의 주의 가중치를 학습한다.
  • STMA에서 이중 주의 메커니즘을 적용: 시퀀스 수준의 맥락을 위한 글로벌 자기주의 모듈과 얼굴 영역 간의 장거리 공간적 종속성을 모델링하기 위한 비국소 자기주의 블록.
  • 다른 세그먼트에서 유도된 특징 간 유클리드 거리를 최대화하여 특징 표현을 정규화함으로써 특징 간의 미세 운동 차이에 대한 민감도를 향상시키는 이질성 증강 손실(DE-Loss)을 통합한다.
  • 학습 중 교차 엔트로피 손실과 DE-Loss를 균형 잡기 위해 무게 계수 λ를 사용하며, 분류 정확도와 운동 분별 능력을 동시에 최적화한다.
  • DSSI에서 고유한 샘플링 프로토콜을 적용하여 각 시퀀스당 네 세트의 세 장짜리 동적 영상 생성을 통해 효율적이고 대표적인 시공간 특징 추출을 가능하게 한다.

실험 결과

연구 질문

  • RQ1유사한 프레임 간의 중복을 줄이면서도 핵심 운동 역학을 유지하기 위해 미세표정 시퀀스를 어떻게 효율적으로 샘플링할 수 있는가?
  • RQ2이중 주의 메커니즘이 미세표정 시퀀스에서 장거리 공간적 및 시간적 종속성을 효과적으로 모델링할 수 있는가?
  • RQ3새로운 손실 함수가 세그먼트 간의 미세 운동 변화를 구분하는 데 네트워크의 능력을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 구성 요소인 DSSI, STMA, DE-Loss가 함께 미세표정 인식 성능 향상에 기여하는 정도는 어떠한가?
  • RQ5DE-Loss의 하이퍼파rameter λ를 통해 분류와 운동 강화 사이의 최적의 균형은 무엇인가?

주요 결과

  • SMA-STN은 SMIC-HS 데이터셋에서 77.44%의 정확도와 0.7683의 F1 점수를 기록하여 이전 SOTA 방법인 TSCNN-I보다 정확도에서 4.70%p, F1 점수에서 0.0447 향상되었다.
  • 제거 실험 결과, STMA와 DE-Loss 모듈이 성능 향상에 뚜렷한 기여를 함을 확인하였으며, 전체 모델(실험 4)은 기준 모델(실험 1) 대비 3.66%p 향상된 77.44%의 정확도를 달성했다.
  • SMIC-HS에서 DE-Loss의 최적 무게 계수 λ는 0.03로 확인되었으며, 이는 운동 분별 능력과 분류 성능 간의 균형을 효과적으로 유지한다.
  • 주의 가중치(α)의 시각화 결과, SMA-STN이 더 많은 미세 운동 정보를 포함한 동적 영상에 더 높은 중요도를 할당하는 것으로 나타나, 주목할 만한 세그먼트에 집중하는 능력을 확인했다.
  • DE-Loss 함수는 세그먼트 간 특징의 차이를 효과적으로 확대하여 특징 공간에서 미세 수준의 운동 변동성에 대한 강건성을 향상시켰다.
  • CASME II, SAMM, SMIC 세 가지 벤치마크에서의 광범위한 실험 결과, SMA-STN이 기존 최신 기술 방법들보다 정확도와 F1 점수 모두에서 일관되게 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.