Skip to main content
QUICK REVIEW

[論文レビュー] Activity Recognition for Autism Diagnosis.

Anish Lakkapragada, Peter Washington|arXiv (Cornell University)|Aug 18, 2021
Autism Spectrum Disorder Research参考文献 39被引用数 4
ひとこと要約

本論文では、動画から手のフラッピング(自閉症関連のステイミング行動)を認識するための軽量LSTMモデルを提案する。時間的変化を伴う手のランドマーク検出を用い、SSBDデータセットで72%の検証精度とF1スコアを達成し、26,000パラメータ未満で実装可能であるため、ウェアラブル機器や遠隔診断システムへの実装が可能となる。

ABSTRACT

A formal autism diagnosis is an inefficient and lengthy process. Families often have to wait years before receiving a diagnosis for their child; some may not receive one at all due to this delay. One approach to this problem is to use digital technologies to detect the presence of behaviors related to autism, which in aggregate may lead to remote and automated diagnostics. One of the strongest indicators of autism is stimming, which is a set of repetitive, self-stimulatory behaviors such as hand flapping, headbanging, and spinning. Using computer vision to detect hand flapping is especially difficult due to the sparsity of public training data in this space and excessive shakiness and motion in such data. Our work demonstrates a novel method that overcomes these issues: we use hand landmark detection over time as a feature representation which is then fed into a Long Short-Term Memory (LSTM) model. We achieve a validation accuracy and F1 Score of about 72% on detecting whether videos from the Self-Stimulatory Behaviour Dataset (SSBD) contain hand flapping or not. Our best model also predicts accurately on external videos we recorded of ourselves outside of the dataset it was trained on. This model uses less than 26,000 parameters, providing promise for fast deployment into ubiquitous and wearable digital settings for a remote autism diagnosis.

研究の動機と目的

  • 正式な自閉症診断には長期間にわたり非効率なプロセスが伴うことが多く、診断の遅延や見逃しを招くことがあるため、その問題を解決すること。
  • デジタル技術を活用した遠隔・自動化された診断ツールを開発し、特にステイミング行動を含む自閉症の行動的兆候を検出すること。
  • 手のフラッピングをコンピュータビジョンで検出するにあたり、公的トレーニングデータが不足していることと、動画の動きの変動が大きいという課題を克服すること。
  • 実用的かつ計算効率の良いモデルを構築し、日常的またはウェアラブルデバイスに統合可能で、リアルタイムでの監視が可能なようにすること。

提案手法

  • 時間経過に伴う2次元手のランドマーク検出を用いて、動画シーケンスから時間的特徴を抽出し、手のフラッピングに関連する動きのパターンを捉える。
  • 得られた時間的ランドマークシーケンスを、順序付き行動パターンをモデル化するための長短期記憶(LSTM)再帰ニューラルネットワークに供給する。
  • モデルは、Self-Stimulatory Behaviour Dataset(SSBD)上でエンドツーエンドに訓練され、動画が手のフラッピングを含むか否かを分類する。
  • パラメータ削減による最適化により、エッジデバイスでの高速推論が可能な26,000パラメータ未満のモデルが実現された。
  • 本手法は、実世界のステイミング動画データに共通するデータのスパarsityと動きの不安定性に対処するため、時間的モデリングを活用している。
  • 外部のSSBD以外の動画データに対して一般化性能を評価し、トレーニング分布を超えた堅牢性を示している。

実験結果

リサーチクエスチョン

  • RQ1時間的ランドマークシーケンスは、データが少ない状況下でも手のフラッピング行動を分類するのに有効に表現できるか?
  • RQ2SSBDで学習したLSTMベースのモデルは、トレーニングデータに含まれない外部の未確認動画データに対し、どの程度一般化できるか?
  • RQ326,000パラメータ未満の軽量モデルが、リアルタイムでウェアラブルな自閉症スクリーニングに十分な性能を達成できるか?
  • RQ4コンピュータビジョン技術は、動きのノイズとデータ不足という課題を克服し、自閉症関連のステイミング行動を検出できるか?

主な発見

  • 提案モデルは、Self-Stimulatory Behaviour Dataset(SSBD)において、手のフラッピング検出で約72%の検証精度を達成した。
  • 同じデータセットでF1スコアが約72%に達し、二値分類における適合率と再現率のバランスが取れていることが示された。
  • トレーニングセットに含まれない外部動画に対しても、モデルは効果的に一般化しており、分布シフトに対しても堅牢であることが確認された。
  • 最終的なモデルは26,000パラメータ未満であり、リソース制限のあるウェアラブル機器やモバイルデバイスへの実装に適している。
  • LSTMによる時間的モデリングは、高い動きの変動性とデータのスパarsityにもかかわらず、手のフラッピングの動的特性を効果的に捉えている。
  • 時間経過に伴う手のランドマーク検出は、自閉症関連の繰り返し行動を特定するための信頼性が高く、効率的な特徴表現として有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。