Skip to main content
QUICK REVIEW

[논문 리뷰] A Facial Affect Analysis System for Autism Spectrum Disorder

Beibin Li, Sachin Mehta|arXiv (Cornell University)|2019. 04. 07.
Autism Spectrum Disorder Research참고 문헌 24인용 수 7
한 줄 요약

이 논문은 자연 이미지 데이터셋으로 훈련된 다중 작업 컨볼루션 신경망(CNN)을 통해 얼굴 특징—표정, 동작 단위(AU), 각성도, 평가도—를 추출하여 자폐 스펙트럼 장애(ASD)를 분류하는 엔드 투 엔드 기계 학습 시스템을 제시한다. 시스템은 76%의 F1 스코어를 기록했으며, 모든 얼굴 특징을 조합했을 때 7%의 성능 향상이 있었고, 이는 이들의 통계적 유의성과 임상적 관련성을 입증한다.

ABSTRACT

In this paper, we introduce an end-to-end machine learning-based system for classifying autism spectrum disorder (ASD) using facial attributes such as expressions, action units, arousal, and valence. Our system classifies ASD using representations of different facial attributes from convolutional neural networks, which are trained on images in the wild. Our experimental results show that different facial attributes used in our system are statistically significant and improve sensitivity, specificity, and F1 score of ASD classification by a large margin. In particular, the addition of different facial attributes improves the performance of ASD classification by about 7% which achieves a F1 score of 76%.

연구 동기 및 목표

  • 실세계 비디오 데이터로부터 얼굴 특징을 사용해 ASD 분류를 위한 엔드 투 엔드 기계 학습 시스템을 개발하는 것.
  • 다양한 얼굴 특징—표정, AU, 각성도, 평가도—가 ASD 분류 성능에 기여하는 방식을 조사하는 것.
  • ASD 탐지 맥락에서 다중 작업 학습 대 단일 작업 학습의 효과성을 평가하는 것.
  • 얼굴 특징가 ASD 분류 민감도, 특이도, F1 스코어 향상에 통계적으로 유의미한 마커가 될 수 있음을 입증하는 것.
  • 대규모 ASD 전용 얼굴 데이터셋이 부족한 상황에서, 대규모 자연 이미지 데이터셋에서 학습된 표현을 활용한 ASD 탐지 프레임워크를 구축하는 것.

제안 방법

  • 다중 작업 CNN은 AffectNet와 EmotioNet라는 두 개의 대규모 자연 이미지 데이터셋에서 동시에 4개의 얼굴 특징—표정, 동작 단위(AU), 각성도, 평가도—를 예측하도록 훈련된다.
  • 네트워크는 표준 CNN 아키텍처를 사용하며, 합성곱 및 풀링 레이어를 포함하고, 작업별 손실과 L2 정규화를 조합한 다중 작업 손실 함수를 최적화한다.
  • 각 비디오 프레임에서 4개 특징의 특징 벡터는 k차원 벡터로 연결되며, AU와 표정은 확률 점수로 표현되고, 각성도와 평가도는 [-1, 1] 범위의 스칼라 값으로 표현된다.
  • 시간적 특징 추출은 통계적 측정치(평균, 표준편차, 활성화 시간, 양성도 비율)를 사용하여 프레임 간에 적용되어 9,575프레임의 시퀀스를 참가자당 58차원의 특징 벡터로 압축된다.
  • 제한된 데이터 상황을 고려해, 이중 분류기(로지스틱 회귀, LASSO, LDA, QDA, SVM, XGBoost, 2층 신경망)를 58D 특징에 대해 이론적 유효성 검증을 위해 이탈리안 교차검증 방식으로 훈련한다.
  • 각 얼굴 특징의 통계적 유의성은 다양한 특징 조합에서의 분류 성능에 대해 스튜던트의 t-검정을 통해 평가된다.

실험 결과

연구 질문

  • RQ1표정, AU, 각성도, 평가도 등 여러 얼굴 특징을 통합할 경우, 부분 집합만 사용하는 것보다 ASD 분류 성능이 향상되는가?
  • RQ2다양한 얼굴 특징가 개별적으로 분류 성능에 기여하는 방식은 어떻게 되며, 어떤 것이 통계적으로 유의미한가?
  • RQ3ASD 탐지 맥락에서 다중 작업 학습이 단일 작업 학습보다 효과적인가?
  • RQ4대규모 ASD 레이블이 부여된 얼굴 데이터셋이 없음에도 불구하고, 자연 이미지에서 학습된 표현이 ASD 분류에 잘 일반화되는가?
  • RQ5ASD 분류에서 F1 스코어, 민감도, 특이도를 최대화하는 최적의 얼굴 특징 조합은 무엇인가?

주요 결과

  • 표정, AU, 각성도, 평가도의 모든 4개 특징을 포함했을 때, 부분 집합만 사용하는 경우 대비 F1 스코어가 7% 향상되어 최종적으로 76%의 F1 스코어를 기록한다.
  • Bottleneck 레이어를 기반 특징 추출기로 사용했을 때 시스템이 가장 높은 분류 성능를 기록했으며, 민감도는 76%, 특이도는 69%였다.
  • 통계 분석(스튜던트의 t-검정)은 각성도(p = 0.007), 평가도(p = 0.001), 표정(p = 0.006)이 분류 성능 향상에 가장 중요한 기여를 했다고 확인했다.
  • 다중 작업 학습 방식은 단일 작업 학습보다 성능이 뛰어나, 여러 특징을 함께 학습함으로써 특징 표현의 품질이 향상됨을 시사한다.
  • 평균, 표준편차, 활성화 시간, 양성도 비율을 사용한 시간적 특징 추출 방법은 비디오 시퀀스 전반의 동적 얼굴 패턴을 효과적으로 포착했으며, 이는 이 작은 데이터셋에서 RNN 및 시간적 CNN보다 우수한 성능을 보였다.
  • 딥 러닝을 통해 자연 이미지에서 학습된 얼굴 특징가 직접 ASD 레이블 데이터로 훈련하지 않더라도 강력하고 통계적으로 유의미한 마커로 기능할 수 있음을 시스템이 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.