[논문 리뷰] Stuttering Speech Disfluency Prediction using Explainable Attribution Vectors of Facial Muscle Movements
이 연구는 성인 스터디아스(aws)의 전음성 얼굴 근육 운동을 분석하여 향후 스터디아스 불순화를 예측하는 설명 가능 인공지능(xai) 강화 콘volution 신경망(cnn)을 제안한다. 얼굴 전기근전도도(emg)에서 유도된 액션 유닛(au)을 사용하여, 불순화된 말하기 전에 상부 얼굴(au6: 볼 들기)과 하부 얼굴(au14: 주름 잡기) 근육의 활동 증가를 식별하며, 설명 가능한 기여 벡터를 통해 높은 예측 정확도를 달성한다.
Speech disorders such as stuttering disrupt the normal fluency of speech by involuntary repetitions, prolongations and blocking of sounds and syllables. In addition to these disruptions to speech fluency, most adults who stutter (AWS) also experience numerous observable secondary behaviors before, during, and after a stuttering moment, often involving the facial muscles. Recent studies have explored automatic detection of stuttering using Artificial Intelligence (AI) based algorithm from respiratory rate, audio, etc. during speech utterance. However, most methods require controlled environments and/or invasive wearable sensors, and are unable explain why a decision (fluent vs stuttered) was made. We hypothesize that pre-speech facial activity in AWS, which can be captured non-invasively, contains enough information to accurately classify the upcoming utterance as either fluent or stuttered. Towards this end, this paper proposes a novel explainable AI (XAI) assisted convolutional neural network (CNN) classifier to predict near future stuttering by learning temporal facial muscle movement patterns of AWS and explains the important facial muscles and actions involved. Statistical analyses reveal significantly high prevalence of cheek muscles (p<0.005) and lip muscles (p<0.005) to predict stuttering and shows a behavior conducive of arousal and anticipation to speak. The temporal study of these upper and lower facial muscles may facilitate early detection of stuttering, promote automated assessment of stuttering and have application in behavioral therapies by providing automatic non-invasive feedback in realtime.
연구 동기 및 목표
- 성인 스터디아스(aws)의 전음성 얼굴 근육 활동이 향후 말의 불순화를 예측하는 데 정보를 담고 있는지 조사한다.
- 비침습적이고 설명 가능한 인공지능(xai) 프레임워크를 개발하여 얼굴 근육 운동 패tern을 기반으로 향후 말이 유창한지 스터디아스된 것으로 분류한다.
- 스터디아스 가능성과 관련된 특정 얼굴 액션 유닛(aus)과 그 시간적 동역학을 규명한다.
- 모델의 예측에 가장 기여하는 얼굴 근육과 시간 창을 설명할 수 있는 해석 가능한 기여 벡터를 제공한다.
- 얼굴 근육 활동이 향후 행동 치료 피드백 시스템을 위한 실시간 비침습적 생물학적 지표로 활용될 잠재력을 탐색한다.
제안 방법
- 스피치 준비 과제(s1-s2 파라다임) 중 성인 스터디아스(aws)의 시간적 시리즈 얼굴 전기근전도도(emg) 신호를 기반으로 훈련된 콘볼루션 신경망(cnn)을 사용한다.
- 모델의 예측에 가장 기여하는 얼굴 근육 운동을 강조하기 위해 계층별 관련성 역전파(lrp)를 적용하여 설명 가능한 기여 벡터를 생성한다.
- 특히 얼굴 운동 코딩 체계(facs)의 액션 유닛(aus) 중에서 au6(볼 들기)와 au14(주름 잡기)를 중심으로 얼굴 근육 활동을 정량화한다.
- 소리 내기 전의 운동 패턴을 포착하기 위해 상부(볼) 및 하부(입) 얼굴 부위의 emg 데이터를 처리한다.
- 말의 내용에 따라 영향을 받는지 평가하기 위해 단어 쌍(wg)과 비단어 쌍(cw) 조건의 두 가지 스피치 과제를 비교한다.
- au6와 au14가 불순화를 예측하는 데 유의미한지 검증하기 위해 통계 분석(p < 0.005)을 시행한다.
실험 결과
연구 질문
- RQ1성인 스터디아스(aws)의 전음성 얼굴 근육 활동은 향후 말이 유창한지 스터디아스된 것으로 예측할 수 있는가?
- RQ2유창한 말과 불순화된 말 시험 간에 가장 구분력 있는 시간적 패턴을 보이는 특정 얼굴 액션 유닛(aus)은 무엇인가?
- RQ3실어휘( wg )와 비어휘( cw ) 조건에서 얼굴 근육 활동 패턴이 다를까? 이는 의미적 내용의 역할에 대해 무엇을 시사하는가?
- RQ4설명 가능한 인공지능(xai) 기법인 lrp는 모델의 결정을 특정 얼굴 근육과 시간 창에 신뢰성 있게 기여하는가?
- RQ5상부 얼굴 aus(예: au6)는 정서적 각성을 반영하는 반면, 하부 얼굴 aus(예: au14)는 말을 하기 위한 준비 상태를 반영하는가? 시간적 동역학에 따르면 그렇다.
주요 결과
- 불순화된 시험에서 상부 얼굴 근육 au6(볼 들기)의 활동이 상당히 높게 관찰되었으며, 이는 유창한 시험보다 유의미하게 높았다(p < 0.005), s1 시작 후 약 800ms에 피크에 도달했다.
- 하부 얼굴 근육 au14(주름 잡기)는 s2 시작 전 지속적인 증가를 보였고, 말 시작 직전에 급격히 상승했으며, 불순화된 시험에서 기여도가 유의미하게 높았다(p < 0.005).
- au6와 au14 활동의 조합은 강력한 예측 능력을 보였으며, 서로 다른 시간적 프로파일을 통해 각각 다른 역할을 하는 것으로 나타났다: au6는 각성, au14는 준비 상태를 반영한다.
- 단어 쌍(wg)과 비단어 쌍(cw) 과제 간에 기여 패턴이 일관되게 유지되어, 예측 신호가 의미적 내용에 의존하지 않음을 시사한다.
- 비침습적 얼굴 emg만을 사용하여도 모델이 유창한 말과 불순화된 말을 높은 해석 가능성과 함께 정확히 구분했다.
- 말 시작 전의 얼굴 근육 활동은 스터디아스 가능성과 관련된 내재된 뇌 상태를 코딩하고 있으며, 이는 얼굴 운동을 비침습적 생물학적 지표로 활용할 수 있음을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.