Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneous imputation and disease classification in incomplete medical datasets using Multigraph Geometric Matrix Completion (MGMC)

Gerome Vivar, Anees Kazi|arXiv (Cornell University)|2020. 05. 14.
Bioinformatics and Genomic Networks참고 문헌 42인용 수 7
한 줄 요약

이 논문은 다중 순환 그래프 컨volution 네트워크를 활용하여 불완전한 다중 모odal 의료 데이터셋에서 동시에 결측치 보정과 질병 분류를 수행하는 엔드 투 엔드 딥 러닝 프레임워크인 Multigraph Geometric Matrix Completion (MGMC)을 제안한다. MGMC는 임상 메타특성(예: 연령, 성별)에 기반해 별도의 그래프로 환자 집단을 모델링하고, 자기 주도 어텐션을 통해 신호를 융합하며, 보존된 클래스 관련 특징을 통해 알츠하이머병 및 파킨슨병 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Large-scale population-based studies in medicine are a key resource towards better diagnosis, monitoring, and treatment of diseases. They also serve as enablers of clinical decision support systems, in particular Computer Aided Diagnosis (CADx) using machine learning (ML). Numerous ML approaches for CADx have been proposed in literature. However, these approaches assume full data availability, which is not always feasible in clinical data. To account for missing data, incomplete data samples are either removed or imputed, which could lead to data bias and may negatively affect classification performance. As a solution, we propose an end-to-end learning of imputation and disease prediction of incomplete medical datasets via Multigraph Geometric Matrix Completion (MGMC). MGMC uses multiple recurrent graph convolutional networks, where each graph represents an independent population model based on a key clinical meta-feature like age, sex, or cognitive function. Graph signal aggregation from local patient neighborhoods, combined with multigraph signal fusion via self-attention, has a regularizing effect on both matrix reconstruction and classification performance. Our proposed approach is able to impute class relevant features as well as perform accurate classification on two publicly available medical datasets. We empirically show the superiority of our proposed approach in terms of classification and imputation performance when compared with state-of-the-art approaches. MGMC enables disease prediction in multimodal and incomplete medical datasets. These findings could serve as baseline for future CADx approaches which utilize incomplete datasets.

연구 동기 및 목표

  • 임상 의사결정 지원 및 컴퓨터 보조 진단(CADx)에 사용되는 다중 모달 의료 데이터셋에서의 결측 데이터 문제를 해결하기 위해.
  • 데이터 제거 또는 별도의 보정 단계 없이 결측 특징을 동시에 보정하고 질병 상태를 분류하는 엔드 투 엔드 학습 프레임워크를 개발하기 위해.
  • 연령, 성별, 인지 기능 등과 같은 고유한 임상 메타특성에 기반한 다중 그래프를 통해 환자 집단을 모델링하여 보정 및 분류 성능을 향상시키기 위해.
  • 그래프 신호 집계와 자기 주도 어텐션 융합을 활용하여 행렬 복원 및 질병 분류 작업 양쪽을 정규화하기 위해.

제안 방법

  • MGMC는 각각 주요 임상 메타특성(예: 연령, 성별, 인지 점수)에서 생성된 별도의 그래프에 대해 훈련된 다수의 독립적인 순환 그래프 컨볼루션 네트워크(RGCNs)를 사용한다.
  • 각 그래프는 환자 유사도가 메타특성 기반으로 계산되는 인구집단 모델을 나타내며, 스펙트럼 메시지 전달을 위한 그래프 라플라시안을 형성한다.
  • 국소 환자 이웃을 활용하여 순환 그래프 컨볼루션을 통해 그래프 신호를 집계함으로써 환자 관계의 순차적 모델링이 가능하다.
  • 다중 그래프 신호 융합은 동적으로 각 그래프의 기여도를 가중치로 설정하는 자기 주도 어텐션 메커니즘을 통해 달성된다.
  • 행렬 복원(보정)과 분류 목표를 통합한 공동 손실 함수를 사용하여 프레임워크를 엔드 투 엔드로 훈련한다.
  • 각 그래프 브랜치 내에서 자동회귀가 아닌 LSTMs를 사용하여 순차적 자동회귀 없이 장거리 의존성을 유지한다.

실험 결과

연구 질문

  • RQ1결측 데이터가 포함된 의료 데이터셋에서 별도 또는 순차적 접근 방식보다 통합된 딥 러닝 프레임워크가 보정과 질병 분류를 더 효과적으로 수행할 수 있는가?
  • RQ2다양한 메타특성 기반의 다중 그래프로 환자 집단을 모델링할 경우, 단일 그래프 또는 비그래프 기반 베이스라인 대비 보정 및 분류 성능 향상이 얼마나 이루어지는가?
  • RQ3다중 그래프 신호의 자기 주도 어텐션 기반 융합이 모델의 일반화 능력과 결측 데이터에 대한 강건성에 얼마나 기여하는가?
  • RQ4이러한 맥락에서 순환 GCN 내 자동회귀가 아닌 LSTMs의 사용이 자동회귀 변종 대비 성능 향상과 훈련 안정성 향상에 기여하는가?
  • RQ5MGMC가 실제 신경퇴행성 질환 데이터셋에서 보정 정확도와 질병 분류 모두에서 최신 기술 수준(SOTA) 방법을 능가할 수 있는가?

주요 결과

  • MGMC는 저작도 행렬 복원(LRMC) 및 잠재 표현 학습 접근 방식을 포함한 최신 기술 수준(SOTA) 방법들보다 ADNI 및 PPMI 데이터셋에서 뛰어난 분류 성능을 달성한다.
  • 특히 다중 모달 및 고차원 데이터 환경에서 보존된 클래스 관련 특징을 통해 보정 정확도가 크게 향상되며, 복원 과정에서의 성능 향상이 뚜렷하다.
  • 제거 실험 결과, 자동회귀가 아닌 LSTMs와 자기 주도 어텐션 메커니즘이 성능 향상에 핵심적인 역할을 함을 확인하였으며, 둘 중 하나를 제거할 경우 성능 저하가 뚜렷하게 발생한다.
  • 다양한 메타특성 기반의 다중 그래프 사용은 단일 그래프 또는 비그래프 기반 베이스라인 대비 더 나은 일반화 및 강건성을 제공한다.
  • MGMC는 두 가지 서로 다른 신경퇴행성 질환 코hort에서 강력한 전이 가능성과 일반화 능력을 보이며, 향후 결측 데이터 기반 CADx 시스템의 기준이 될 잠재력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.