Skip to main content
QUICK REVIEW

[論文レビュー] A Two-stream End-to-End Deep Learning Network for Recognizing Atypical Visual Attention in Autism Spectrum Disorder

Jin Xie, Longfei Wang|arXiv (Cornell University)|Nov 26, 2019
Autism Spectrum Disorder Research参考文献 1被引用数 10
ひとこと要約

本稿では、自閉症スペクトラム障害(ASD)における特異的視覚注意の分類を目的として、眼動跡データと視覚画像を統合して処理する2ストリームのエンドツーエンドディープラーニングネットワークを提案する。2つの異なるストリームから得られる空間的および時間的特徴を活用することで、モデルはASDと通常発達(TD)の個々の個人を区別する際、95%の正確性を達成し、従来の最先端手法を上回った。

ABSTRACT

Eye movements have been widely investigated to study the atypical visual attention in Autism Spectrum Disorder (ASD). The majority of these studies have been focused on limited eye movement features by statistical comparisons between ASD and Typically Developing (TD) groups, which make it difficult to accurately separate ASD from TD at the individual level. The deep learning technology has been highly successful in overcoming this issue by automatically extracting features important for classification through a data-driven learning process. However, there is still a lack of end-to-end deep learning framework for recognition of abnormal attention in ASD. In this study, we developed a novel two-stream deep learning network for this recognition based on 700 images and corresponding eye movement patterns of ASD and TD, and obtained an accuracy of 0.95, which was higher than the previous state-of-the-art. We next characterized contributions to the classification at the single image level and non-linearly integration of this single image level information during the classification. Moreover, we identified a group of pixel-level visual features within these images with greater impacts on the classification. Together, this two-stream deep learning network provides us a novel and powerful tool to recognize and understand abnormal visual attention in ASD.

研究の動機と目的

  • 眼動跡と画像データを統合するエンドツーエンドのディープラーニングフレームワークを構築し、個別レベルでのASD分類を実現すること。
  • 手作業で特徴を抽出する従来の統計的手法に起因する制限を克服し、個別レベルでの識別を可能にすること。
  • 分類性能に最も寄与するピクセルレベルの視覚的特徴を同定すること。
  • 分類プロセス中に個々の画像からの情報が非線形的にどのように統合されるかを分析し、検出精度を向上させること。

提案手法

  • モデルは2つの並列の畳み込みニューラルネットワークストリームを採用している:1つは眼動跡の軌跡を処理し、もう1つは静的視覚画像を処理する。
  • 各ストリームは、複数の畳み込み層およびプーリング層を通じて階層的な特徴表現を学習し、空間的および時間的パターンを捉える。
  • 両ストリームの特徴は、後期統合段階で連結され、共同表現学習が可能になる。
  • 分類性能を最適化するために、確率的勾配降下法を用いてクロスエントロピー損失に基づきエンドツーエンドでネットワークを訓練する。
  • 分類意思決定に影響を与える重要な画像領域を特定するために、勾配に基づくサリエンシー手法が適用された。
  • モデルは、ASDおよびTD参加者から得られた700枚の画像とそれに対応する眼動跡パターンを含むデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ12ストリームのディープラーニングアーキテクチャは、従来の手法を上回るASD分類を実現するために、眼動跡と視覚画像データを効果的に統合できるか?
  • RQ2画像内での特定の視覚的特徴のうち、モデルの意思決定プロセスに最も顕著に寄与しているものは何か?
  • RQ32つのストリーム間で、個々の画像からの情報が非線形的にどのように統合され、分類性能が向上しているか?
  • RQ4モデルは、現実世界の状況において、ASDとTDの個別レベルでの識別にどの程度一般化可能か?

主な発見

  • 提案された2ストリームネットワークは、95%の分類正確性を達成し、従来の最先端性能を上回った。
  • モデルは、生の入力データから複雑でデータ駆動型の表現を学習することで、優れた個別レベルの識別性能を示した。
  • ピクセルレベルのサリエンシー解析により、顔貌および社会的文脈領域に特に高い影響を持つ画像領域が特定された。
  • 両ストリームからの特徴の非線形統合は、初期統合や統合なしの手法と比較して、顕著に分類性能を向上させた。
  • モデルは、従来の統計的手法では検出できなかったASDにおける微細な特異的視覚注意パターンを効果的に捉えた。
  • 眼動跡のダイナミクスと静的画像特徴の統合により、ASD関連の視覚注意異常の強固で説明可能な分類が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。