Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Motion Boundaries in an End-to-End Network for Vision-based Parkinson's Severity Assessment

Amirhossein Dadashzadeh, Alan Whone|arXiv (Cornell University)|2020. 01. 01.
Parkinson's Disease Mechanisms and Treatments인용 수 8
한 줄 요약

이 논문은 동작 경계와 시간 주기적 주의 메커니즘을 갖춘 팽창된 3차원 컨volution 신경망(I3D)을 사용하여 영상에서 파킨슨병의 중증도를 평가하는 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 보행 작업에서 77.1%의 상위 1위 정확도와 손 움직임 작업에서 72.3%의 정확도를 달성하여, 동작 경계가 카메라 운동에 대한 강인성과 RGB 및 광학 흐름만을 사용할 때보다 모델 성능을 크게 향상시킨다는 것을 입증한다.

ABSTRACT

Evaluating neurological disorders such as Parkinson's disease (PD) is a challenging task that requires the assessment of several motor and non-motor functions. In this paper, we present an end-to-end deep learning framework to measure PD severity in two important components, hand movement and gait, of the Unified Parkinson's Disease Rating Scale (UPDRS). Our method leverages on an Inflated 3D CNN trained by a temporal segment framework to learn spatial and long temporal structure in video data. We also deploy a temporal attention mechanism to boost the performance of our model. Further, motion boundaries are explored as an extra input modality to assist in obfuscating the effects of camera motion for better movement assessment. We ablate the effects of different data modalities on the accuracy of the proposed network and compare with other popular architectures. We evaluate our proposed method on a dataset of 25 PD patients, obtaining 72.3% and 77.1% top-1 accuracy on hand movement and gait tasks respectively.

연구 동기 및 목표

  • 영상 데이터를 이용한 파킨슨병 중증도 평가를 위한 자동화된 엔드 투 엔드 시각 기반 방법을 개발한다.
  • 보조 입력 모odalities로 동작 경계를 도입하여 카메라 운동에 대한 강인성을 향상시킨다.
  • 희소한 시간 샘플링을 통해 장거리 시간적 구조를 활용하여 운동 과제의 시간적 모델링을 향상시킨다.
  • 핵심 영상 세그먼트에 집중할 수 있도록 시간 주의 메커니즘을 통합하여 분류 정확도를 향상시킨다.
  • UPDRS 과제 성능에서 광학 흐름, RGB 및 동작 경계 입력 모달리티의 독립적 및 조합적 효과를 평가한다.

제안 방법

  • 프레임워크는 영상 스니펫에서 연합된 공간-시간 특징을 추출하기 위해 팽창된 3차원 컨volution 신경망(I3D)을 사용한다.
  • 비중첩 영상 세그먼트를 처리하기 위해 희소한 시간 샘플링 전략을 사용하여 장거리 시간적 동역학을 효율적으로 모델링할 수 있도록 한다.
  • 시간 주의 메커니즘이 각 영상 세그먼트에 대해 학습 가능한 가중치를 할당하여 모델이 가장 구분력 있는 세그먼트에 집중할 수 있도록 한다.
  • 광학 흐름에서 계산된 동작 경계를 추가 입력 모달리티로 사용하여 카메라 운동의 영향을 억제한다.
  • UPDRS 평가에서 클래스 불균형 문제를 해결하기 위해 포칼 손실 함수를 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 입력 모달리티로는 RGB, 광학 흐름, 동작 경계를 포함하며, 단일 및 다중 스트림 구성에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1카메라 운동이 존재하는 상황에서 동작 경계가 파킨슨병 중증도 평가에 있어 강인하고 효과적인 입력 모달리티로 기능할 수 있는가?
  • RQ2시간 주의 메커니즘의 통합이 파킨슨병 환자에서 운동 과제 평가의 분류 정확도를 어떻게 향상시키는가?
  • RQ3RGB, 광학 흐름, 동작 경계 등의 다양한 입력 모달리티가 엔드 투 엔드 영상 기반 UPDRS 스코링에서 비교적으로 어떤 성능을 보이는가?
  • RQ4제안된 방법이 동일한 파킨슨병 중증도 평가 과제에서 TSN, I3D, SlowFast와 같은 최신 아키텍처를 얼마나 뛰어넘는가?
  • RQ5포칼 손실을 사용할 경우 표준 교차 엔트로피 손실 대비 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 동작 경계만으로도 손 움직임 과제에서 72.3%의 상위 1위 정확도를 달성하여 RGB(68.4%)와 광학 흐름(71.0%)보다 각각 3.9%, 1.3%p 높은 성능을 보였다.
  • 광학 흐름과 동작 경계의 조합이 보행 과제에서 가장 높은 성능을 보였으며, 상위 1위 정확도 77.1%를 기록하여 모든 다른 단일 또는 이중 모달리티 조합을 앞섰다.
  • 제안된 방법은 두 과제 평균 74.4%의 정확도를 달성하여 TSN(72.9%), I3D(71.1%), SlowFast(67.0%)와 같은 최신 기술을 초월했다.
  • 시간 주의 메커니즘의 통합은 모든 모달리티에서 성능 향상을 가져왔으며, 손 움직임 과제에서 가장 높은 향상이 관찰되었다.
  • 포칼 손실을 사용할 경우 일반 교차 엔트로피 손실 대비 평균 정확도가 1.3%p 향상되어 UPDRS 평가에서 클래스 불균형을 다루는 데서 중요한 역할을 한다는 것을 입증했다.
  • 단절 실험을 통해 동작 경계가 성능 향상에 기여하는 중요한 효과적인 모달리티임을 확인하였으며, RGB 및 광학 흐름과 조합해도 성능 향상이 지속되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.