Skip to main content
QUICK REVIEW

[論文レビュー] Stuttering Speech Disfluency Prediction using Explainable Attribution Vectors of Facial Muscle Movements

Arun Das, Jeffrey R. Mock|arXiv (Cornell University)|Oct 2, 2020
Stuttering Research and Treatment参考文献 28被引用数 4
ひとこと要約

本研究では、大人の口吃者(AWS)の発話前の顔面筋の動きを分析することで、近い将来の口吃的不順応を予測する、説明可能なAI(XAI)を強化した畳み込みニューラルネットワーク(CNN)を提案する。顔面筋電図(EMG)からのアクションユニット(AUs)を用い、不順応発話の前に対応する上顔面(AU6:頬を上げる筋)および下顔面(AU14:頬のしわを寄せる筋)の活動が顕著に高まることが特定され、解釈可能な帰属ベクトルを用いて高い予測精度を達成した。

ABSTRACT

Speech disorders such as stuttering disrupt the normal fluency of speech by involuntary repetitions, prolongations and blocking of sounds and syllables. In addition to these disruptions to speech fluency, most adults who stutter (AWS) also experience numerous observable secondary behaviors before, during, and after a stuttering moment, often involving the facial muscles. Recent studies have explored automatic detection of stuttering using Artificial Intelligence (AI) based algorithm from respiratory rate, audio, etc. during speech utterance. However, most methods require controlled environments and/or invasive wearable sensors, and are unable explain why a decision (fluent vs stuttered) was made. We hypothesize that pre-speech facial activity in AWS, which can be captured non-invasively, contains enough information to accurately classify the upcoming utterance as either fluent or stuttered. Towards this end, this paper proposes a novel explainable AI (XAI) assisted convolutional neural network (CNN) classifier to predict near future stuttering by learning temporal facial muscle movement patterns of AWS and explains the important facial muscles and actions involved. Statistical analyses reveal significantly high prevalence of cheek muscles (p<0.005) and lip muscles (p<0.005) to predict stuttering and shows a behavior conducive of arousal and anticipation to speak. The temporal study of these upper and lower facial muscles may facilitate early detection of stuttering, promote automated assessment of stuttering and have application in behavioral therapies by providing automatic non-invasive feedback in realtime.

研究の動機と目的

  • 発話前の顔面筋活動が、大人の口吃者(AWS)における近い発話の不順応を予測する情報を含むかどうかを調査すること。
  • 発話の流れを「流暢」または「口吃的」に分類するため、顔面筋の動きのパターンを用いて非侵襲的かつ説明可能なAI(XAI)フレームワークを開発すること。
  • 口吃的発話の可能性と相関する顔面のアクションユニット(AUs)およびその時間的ダイナミクスを同定すること。
  • モデルの予測に最も寄与する顔面筋および時間窓を説明可能な帰属ベクトルで明らかにすること。
  • 顔面筋の活動が、将来的な行動療法フィードバックシステムの構築に向けた、リアルタイムで非侵襲的なバイオマーカーとしての可能性を検討すること。

提案手法

  • S1-S2パラダイムにおける発話準備タスク中に収集したAWSの時系列的顔面筋電図(EMG)信号を用いて訓練された畳み込みニューラルネットワーク(CNN)を用いる。
  • モデルの予測に寄与する顔面筋の動きを強調する説明可能な帰属ベクトルを生成するために、レイヤーごとの関係バックプロパゲーション(LRP)を適用する。
  • 顔面行動コード化システム(FACS)に由来するアクションユニット(AUs)に焦点を当て、特にAU6(頬を上げる筋)とAU14(しわを寄せる筋)を用いて顔面筋活動を定量的に評価する。
  • 発声開始前の前駆動パターンを捉えるために、上顔面(頬)および下顔面(唇)領域のEMGデータを処理する。
  • 語のペア(WG)と非語のペア(CW)の2つの発話タスクを比較し、発話内容の違いに伴う予測の頑健性を評価する。
  • AU6およびAU14が不順応を予測する上で有意であることを検証するために、統計的分析(p < 0.005)を実施する。

実験結果

リサーチクエスチョン

  • RQ1発話前の顔面筋活動は、AWSの発話が流暢か口吃的かを予測できるか?
  • RQ2流暢と不順応の発話試行の間に、どの顔面アクションユニット(AUs)が最も特徴的な時間的パターンを示すか?
  • RQ3実語(WG)と非語(CW)を含む発話準備タスクにおいて、顔面筋活動のパターンに差異があるか。これは意味的コンテンツの役割に何を示唆するか?
  • RQ4説明可能なAI(XAI)技術、例えばLRPは、モデルの意思決定を特定の顔面筋および時間窓に信頼性を持って帰属づけることができるか?
  • RQ5上顔面のAUs(例:AU6)は情動の高揚を、下顔面のAUs(例:AU14)は発話への予測を反映していると、時間的ダイナミクスが示唆するが、その通りか?

主な発見

  • 不順応試行では、流暢試行と比較して上顔面筋のAU6(頬を上げる筋)の活性が顕著に高まっており、S1開始後800 msにピークに達した(p < 0.005)。
  • 下顔面筋のAU14(しわを寄せる筋)はS2開始の前から持続的に増加し、発話直前に急激に上昇した。不順応試行では、AU14の帰属が顕著に高かった(p < 0.005)。
  • AU6とAU14の活動の組み合わせにより強い予測力が得られ、時間的プロファイルの違いから、AU6は情動の高揚、AU14は発話への予測にそれぞれ関与している可能性が示唆された。
  • 語のペア(WG)と非語のペア(CW)の両タスクにおいて、帰属パターンが一貫しており、予測信号が意味的コンテンツに依存しないことを示した。
  • 非侵襲的な顔面EMGのみを用いて、XAI手法による高い解釈可能性を伴い、流暢と不順応の発話を成功裏に区別できた。
  • 発声開始前の顔面筋活動は、口吃的発生の可能性に関連する脳内状態を符号化しており、顔面運動を非侵襲的バイオマーカーとして用いる根拠を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。