Skip to main content
QUICK REVIEW

[논문 리뷰] A Two-stream End-to-End Deep Learning Network for Recognizing Atypical Visual Attention in Autism Spectrum Disorder

Jin Xie, Longfei Wang|arXiv (Cornell University)|2019. 11. 26.
Autism Spectrum Disorder Research참고 문헌 1인용 수 10
한 줄 요약

이 논문은 자폐성 장애(ASD)에서 이질적인 시각적 주의를 분류하기 위해 눈동자의 움직임 데이터와 시각적 이미지를 동시에 처리하는 양방향 엔드 투 엔드 딥 러닝 네트워크를 제안한다. 두 개의 별도된 스트림으로부터 공간적 및 시간적 특징을 활용함으로써, 이 모델은 일반 발달자녀와의 구별에서 95%의 정확도를 달성하며 기존 최고 수준의 방법을 능가한다.

ABSTRACT

Eye movements have been widely investigated to study the atypical visual attention in Autism Spectrum Disorder (ASD). The majority of these studies have been focused on limited eye movement features by statistical comparisons between ASD and Typically Developing (TD) groups, which make it difficult to accurately separate ASD from TD at the individual level. The deep learning technology has been highly successful in overcoming this issue by automatically extracting features important for classification through a data-driven learning process. However, there is still a lack of end-to-end deep learning framework for recognition of abnormal attention in ASD. In this study, we developed a novel two-stream deep learning network for this recognition based on 700 images and corresponding eye movement patterns of ASD and TD, and obtained an accuracy of 0.95, which was higher than the previous state-of-the-art. We next characterized contributions to the classification at the single image level and non-linearly integration of this single image level information during the classification. Moreover, we identified a group of pixel-level visual features within these images with greater impacts on the classification. Together, this two-stream deep learning network provides us a novel and powerful tool to recognize and understand abnormal visual attention in ASD.

연구 동기 및 목표

  • ASD의 개인 수준 분류를 위한 눈동자 움직임과 이미지 데이터를 통합하는 엔드 투 엔드 딥 러닝 프레임워크를 개발하기 위해.
  • 수작업 특징에 의존하고 개인 수준의 구별 능력이 떨어지는传통적 통계 방법의 한계를 극복하기 위해.
  • 분류 성능에 가장 기여하는 주요 픽셀 수준의 시각적 특징을 특정하기 위해.
  • 개별 이미지에서 온 정보가 분류 과정에서 비선형적으로 어떻게 통합되어 정확도를 향상시키는지 분석하기 위해.

제안 방법

  • 모델는 눈동자 움직임 궤적을 처리하는 하나의 스트림과 정적 시각적 이미지를 처리하는 다른 하나의 스트림을 갖춘 병렬 컨볼루션 신경망 스트림을 활용한다.
  • 각 스트림은 다중 컨볼루션 및 풀링 레이어를 통해 계층적인 특징 표현을 학습하여 공간적 및 시간적 패턴을 포착한다.
  • 두 스트림의 특징는 후기 융합 단계에서 연결되어 공동 표현 학습을 가능하게 한다.
  • 분류 성능를 최적화하기 위해 교차 엔트로피 손실과 확률적 경사 하강법을 사용하여 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 분류 결정에 영향을 주는 핵심 이미지 영역을 특정하기 위해 기울기 기반의 시각화 방법을 적용한다.
  • ASD 및 일반 발달 참가자로부터 수집된 700개의 이미지와 해당 눈동자 움직임 패턴을 포함한 데이터셋에서 모델을 평가한다.

실험 결과

연구 질문

  • RQ1양방향 딥 러닝 아키텍처가 전통적 방법을 뛰어넘어 눈동자 움직임과 시각적 이미지 데이터를 효과적으로 융합하여 ASD 분류 성능을 향상시킬 수 있는가?
  • RQ2이미지 내에서 모델의 결정 과정에 가장 크게 기여하는 특정 시각적 특징은 무엇인가?
  • RQ3두 스트림을 통해 개별 이미지에서 온 정보가 분류 성능 향상을 위해 비선형적으로 어떻게 통합되는가?
  • RQ4모델가 실제 환경에서 ASD와 일반 발달자녀의 개인 수준의 구별에 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 양방향 네트워크는 분류 정확도 95%를 달성하여 이전 최고 수준의 성능를 뛰어넘었다.
  • 모델는 원시 입력 데이터로부터 복잡한 데이터 기반 표현을 학습함으로써 뛰어난 개인 수준의 구별 능력을 보였다.
  • 픽셀 수준의 시각화 분석을 통해 얼굴 및 사회적 맥락 영역에서 특히 높은 영향력을 가진 특정 이미지 영역가 식별되었다.
  • 두 스트림의 특징를 비선형적으로 융합함으로써, 초기 융합 또는 융합 없음 대비 분류 성능이 크게 향상되었다.
  • 모델는 기존 통계 분석으로는 탐지할 수 없었던 ASD에서의 미세한 이질적인 시각적 주의 패턴을 성공적으로 포착하였다.
  • 눈동자 움직임의 동적 특징과 정적 이미지 특징의 통합은 ASD 관련 시각적 주의 이상에 대한 강력하고 해석 가능한 분류를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.