Skip to main content
QUICK REVIEW

[論文レビュー] A Two-stage Multi-modal Affect Analysis Framework for Children with Autism Spectrum Disorder

Jicheng Li, Anjana Bhat|arXiv (Cornell University)|Jun 17, 2021
Autism Spectrum Disorder Research参考文献 27被引用数 7
ひとこと要約

本論文は、遊び療法中の自閉症スペクトラム症候群(ASD)児の感情状態を、肯定的、否定的、中立の3つの状態に分類するため、音声と顔の感情認識を用いた2段階のマルチモodalフレームワークを提案する。人間の専門的知見を活用して2段階のスキーム(最初に声の特徴に基づいて否定的状態を検出し、次に顔の表情に基づいて肯定的と中立を区別)を設計することで、全体の正解率は72.40%に達し、ASD向けの感情分析における人間の知見と機械学習の新規統合を実現した。

ABSTRACT

Autism spectrum disorder (ASD) is a developmental disorder that influences the communication and social behavior of a person in a way that those in the spectrum have difficulty in perceiving other people's facial expressions, as well as presenting and communicating emotions and affect via their own faces and bodies. Some efforts have been made to predict and improve children with ASD's affect states in play therapy, a common method to improve children's social skills via play and games. However, many previous works only used pre-trained models on benchmark emotion datasets and failed to consider the distinction in emotion between typically developing children and children with autism. In this paper, we present an open-source two-stage multi-modal approach leveraging acoustic and visual cues to predict three main affect states of children with ASD's affect states (positive, negative, and neutral) in real-world play therapy scenarios, and achieved an overall accuracy of 72:40%. This work presents a novel way to combine human expertise and machine intelligence for ASD affect recognition by proposing a two-stage schema.

研究の動機と目的

  • 既存のアプローチが一般感情データセットに依存しており、ASD特有の感情表現パターンを考慮しないことから、ASD児向けに特化した感情認識モデルの不足に対処する。
  • ドメインシフト、データノイズ、スパarselyラベル付けされたデータといった、現実世界の遊び療法データにおける課題を、トランスファー学習とファインチューニング技術の適応によって克服する。
  • 臨床的知見(例:否定的状態における特徴的な声のパターン、肯定的と中立状態における顔の表情の違い)を機械学習パイプラインに統合するフレームワークを構築する。
  • 今後のASDにおける自動療法評価や臨床的アノテーション研究を支援する、再現可能でオープンソースのベースラインを提供する。
  • 物理療法士がビデオ記録から児の感情状態を自動検出することで、療法の成果をより効率的に評価できるようにする。

提案手法

  • 2段階分類スキームを用いる:最初に、叫び声や叫ぶ声などの声の特徴に基づいて、子供が否定的状態にあるかどうかを音声感情認識(SER)で分類する。
  • 2段階目では、非否定的クリップを顔の表情認識(FER)に基づいて肯定的または中立の感情状態に分類する。
  • ASD感情データセット(実世界の屋外での療法記録を含む)に適応させるために、SERおよびFERの両方で事前学習済みモデルを用いたトランスファー学習とファインチューニングを実施する。
  • 元々人間の専門家によるアノテーションがなされていたが、機械に適したデータであるように、ASD感情データセットのノイズ、低解像度、不一致ラベルを処理するための包括的なデータ後処理とクリーニングを実施する。
  • 参加者ごとの予測結果を正規化して、動画クリップ数のばらつきを補正し、データセット内の多様な個人間での公平な評価を確保する。
  • 全3クラスの感情状態における性能を評価するために、混同行列とF1スコアを用い、各段階ごとにクラス別性能のギャップを特定する分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1現実世界の遊び療法セッションにおいて、2段階のマルチモーダルフレームワークは、ASD児の肯定的、否定的、中立の感情状態を効果的に区別できるか?
  • RQ2臨床的専門的知見(具体的には、否定的状態における特徴的な声のパターン、肯定的と中立状態における顔の特徴)の統合が、ASD感情認識における機械学習の性能をどの程度向上させるか?
  • RQ3通常発達児とASD児との間のドメインシフトが、ASD固有のデータに対して事前学習済み感情認識モデルの性能に及ぼす影響はどの程度か?
  • RQ4低解像度、背景ノイズ、長時間のラベルなしクリップといったデータ品質の問題が、現実世界の療法記録における感情認識の正確性にどのように影響するか?
  • RQ5機械学習を活用して手作業の負荷を軽減しつつ正確性を維持できるように、臨床医が療法ビデオをアノテートするための準自動アノテーションフレームワークを開発できるか?

主な発見

  • 全3クラス(肯定的、否定的、中立的)における感情認識全体の正解率は72.40%に達し、F1スコアは0.75に達した。これは、実世界のASD療法データにおいて2段階フレームワークの実現可能性を示している。
  • 1段階目(否定的 vs. 非否定的)では、少数クラス(否定的)のリコールが68.42%に達し、声の特徴に基づく否定的状態の検出において中程度の性能を示した。
  • 2段階目(肯定的 vs. 中立的)では、中立のリコールが78.29%、肯定的が63.24%に達し、F1スコアは0.79に達した。これは、中立と肯定的状態の区別においてより高い性能を示している。
  • 参加者ごとの正規化された予測結果から、モデルの一般化性能が高く、パーソナライズドな混同行列図において、緑色と青色の領域が広がっていることから、一貫した正しく分類されていることが示された。
  • このデータセットでは、音声感情認識(SER)が顔の感情認識(FER)を上回った。これは、否定的状態においてより明確で識別しやすい声のパターン(例:叫び声)があるためと考えられる。
  • 支配的クラスと非支配的クラスの間の性能差は、特に低解像度やノイズ環境下で、肯定的と中立状態の顔の微細な違いを認識する難しさを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。