[논문 리뷰] Multi-scale multi-modal micro-expression recognition algorithm based on transformer
이 논문은 다중 스케일, 다중 모odal 마이크로 음성 인식 알고리즘을 제안하며, 다중 헤드 자기주의 주의와 교차 모달 대비 학습을 통해 다양한 공간 스케일에서 운동 및 텍스처 특징을 융합한다. SMIC에서 78.73%의 정확도와 CASMEII 병합 데이터셋에서 0.9071의 F1 스코어를 기록하여 최신 기술 수준의 성능을 달성한다.
A micro-expression is a spontaneous unconscious facial muscle movement that can reveal the true emotions people attempt to hide. Although manual methods have made good progress and deep learning is gaining prominence. Due to the short duration of micro-expression and different scales of expressed in facial regions, existing algorithms cannot extract multi-modal multi-scale facial region features while taking into account contextual information to learn underlying features. Therefore, in order to solve the above problems, a multi-modal multi-scale algorithm based on transformer network is proposed in this paper, aiming to fully learn local multi-grained features of micro-expressions through two modal features of micro-expressions - motion features and texture features. To obtain local area features of the face at different scales, we learned patch features at different scales for both modalities, and then fused multi-layer multi-headed attention weights to obtain effective features by weighting the patch features, and combined cross-modal contrastive learning for model optimization. We conducted comprehensive experiments on three spontaneous datasets, and the results show the accuracy of the proposed algorithm in single measurement SMIC database is up to 78.73% and the F1 value on CASMEII of the combined database is up to 0.9071, which is at the leading level.
연구 동기 및 목표
- 마이크로 음성의 지속 시간이 짧고 얼굴 영역에서 공간 스케일이 다양하기 때문에 인식에 어려움이 존재하는 문제를 해결하기 위해.
- 운동 및 텍스처 모달 모두에서 다양한 스케일에서 다중 입자 크기의 국소적 특징을 캡처함으로써 특징 추출을 향상시키기 위해.
- 다중 헤드 자기주의 주의 기반의 특징 융합을 통해 표현 학습을 향상시키기 위해.
- 운동 및 텍스처 임베딩을 정렬하기 위해 교차 모달 대비 학습을 사용하여 모델을 최적화하기 위해.
- 자연스러운 마이크로 음성 인식 벤치마크에서 최신 기술 수준의 성능를 달성하기 위해.
제안 방법
- 이 방법은 다중 스케일에서 운동 및 텍스처 특징을 별도로 처리하기 위해 이중 스트림 트랜스포머 아키텍처를 사용한다.
- 모든 모달리티에서 다양한 해상도의 얼굴 영역에서 패치 수준의 특징을 추출하여 다중 스케일 국소 패턴을 캡처한다.
- 각 모달리티에 대해 다층 다중 헤드 자기주의 주의를 적용하여 맥락적 관계에 기반해 패치 특징을 가중 및 집계한다.
- 다양한 스케일에서의 주의 가중치를 융합하여 개선된 스케일에 강인한 표현을 생성한다.
- 운동 및 텍스처 특징 공간을 정렬하기 위해 교차 모달 대비 학습을 사용하여 일반화 능력과 표현 품질을 향상시킨다.
- 최종 특징을 융합하고 엔드 투 엔드로 훈련된 분류기 헤드를 사용하여 분류한다.
실험 결과
연구 질문
- RQ1다중 스케일, 다중 모달 접근 방식이 다양한 얼굴 영역에서 세밀한 공간 패턴을 캡처함으로써 마이크로 음성 인식을 향상시킬 수 있는가?
- RQ2트랜스포머 기반 아키텍처가 마이크로 음성 시퀀스에서 장거리 의존성과 맥락적 관계를 얼마나 효과적으로 모델링할 수 있는가?
- RQ3교차 모달 대비 학습이 운동 및 텍스처 모달 간의 특징 정렬에 얼마나 기여하는가?
- RQ4제안된 방법이 자연스러운 마이크로 음성 데이터셋에서 기존 최신 기술 수준의 모델을 초월하는가?
- RQ5다중 스케일 패치 특징의 통합이 인식 정확도와 강인성에 어떻게 영향을 미치는가?
주요 결과
- 제안된 방법은 자연스러운 마이크로 음성 데이터셋인 SMIC에서 78.73%의 정확도를 달성하여 이전 방법들을 능가했다.
- 병합된 CASMEII 데이터셋에서 모델은 F1 스코어 0.9071을 기록하여 다중 클래스 인식에서 뛰어난 성능을 보였다.
- 다중 스케일 패치 특징의 사용이 다양한 공간 해상도에서 미세한 얼굴 운동을 캡처하는 데 모델의 능력을 크게 향상시켰다.
- 교차 모달 대비 학습이 운동 및 텍스처 임베딩 간의 정렬을 향상시켜 특징의 구분 능력을 강화시켰다.
- 다양한 스케일에서 다중 헤드 자기주의 주의의 융합이 더 강인하고 맥락 인식 능력이 뛰어난 특징 표현을 이끌어냈다.
- 기본 데이터셋에서 다양한 평가 지표에서 모델이 최신 기술 수준의 성능를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.