Skip to main content
QUICK REVIEW

[論文レビュー] Simultaneous imputation and disease classification in incomplete medical datasets using Multigraph Geometric Matrix Completion (MGMC)

Gerome Vivar, Anees Kazi|arXiv (Cornell University)|May 14, 2020
Bioinformatics and Genomic Networks参考文献 42被引用数 7
ひとこと要約

本稿では、複数の再帰的グラフ畳み込みネットワークを活用して、不完全なマルチモodal医療データセットにおける欠損値補完と疾患分類を統合的に実行するエンド・ツー・エンドのディープラーニングフレームワーク、Multigraph Geometric Matrix Completion (MGMC) を提案する。MGMCは、年齢、性別などの臨床的メタ特徴に基づいて別々のグラフで患者集団をモデル化し、自己注意機構を用いて信号を統合することで、補完中にクラス関連特徴を保持し、アルツハイマー病およびパーキンソン病のデータセットで最先端の性能を達成する。

ABSTRACT

Large-scale population-based studies in medicine are a key resource towards better diagnosis, monitoring, and treatment of diseases. They also serve as enablers of clinical decision support systems, in particular Computer Aided Diagnosis (CADx) using machine learning (ML). Numerous ML approaches for CADx have been proposed in literature. However, these approaches assume full data availability, which is not always feasible in clinical data. To account for missing data, incomplete data samples are either removed or imputed, which could lead to data bias and may negatively affect classification performance. As a solution, we propose an end-to-end learning of imputation and disease prediction of incomplete medical datasets via Multigraph Geometric Matrix Completion (MGMC). MGMC uses multiple recurrent graph convolutional networks, where each graph represents an independent population model based on a key clinical meta-feature like age, sex, or cognitive function. Graph signal aggregation from local patient neighborhoods, combined with multigraph signal fusion via self-attention, has a regularizing effect on both matrix reconstruction and classification performance. Our proposed approach is able to impute class relevant features as well as perform accurate classification on two publicly available medical datasets. We empirically show the superiority of our proposed approach in terms of classification and imputation performance when compared with state-of-the-art approaches. MGMC enables disease prediction in multimodal and incomplete medical datasets. These findings could serve as baseline for future CADx approaches which utilize incomplete datasets.

研究の動機と目的

  • 臨床意思決定支援およびコンピュータ支援診断(CADx)に用いられるマルチモーダル医療データセットにおける欠損データ問題に対処すること。
  • 欠損データの除去や別個の補完ステップを伴わず、同時に欠損特徴の補完と疾患状態の分類を実行するエンド・ツー・エンドの学習フレームワークの開発すること。
  • 年齢、性別、認知機能など、異なる臨床的メタ特徴に基づく複数のグラフを用いて患者集団をモデル化することで、補完および分類性能の向上を図ること。
  • グラフ信号の集約と自己注意による統合を活用し、行列再構成および疾患分類の両タスクに対する正則化を実現すること。

提案手法

  • MGMCは、各々が主要な臨床的メタ特徴(例:年齢、性別、認知スコア)から構築された別個のグラフで学習される複数の独立した再帰的グラフ畳み込みネットワーク(RGCN)を採用する。
  • 各グラフは、患者の類似度がメタ特徴に基づいて計算され、スペクトル的メッセージパッシングに適したグラフラプラシアンを形成する、集団モデルを表す。
  • 局所的な患者の近隣領域を用いて、再帰的グラフ畳み込みによりグラフ信号を集約することで、患者関係の順次的モデリングを可能にする。
  • 複数グラフ信号の統合は、各グラフからの寄与度を動的に重み付けする自己注意機構により実現され、統一された表現が得られる。
  • フレームワークは、行列再構成(補完)と分類の目的関数を統合したジョイント損失関数を用いてエンド・ツー・エンドで訓練される。
  • 各グラフブランチ内では、順次的自己回帰なしに長距離依存性を保持する非自己回帰的LSTMが使用される。

実験結果

リサーチクエスチョン

  • RQ1分離的または逐次的なアプローチよりも、統合的補完と疾患分類をより効果的に行うための統一されたディープラーニングフレームワークは、不完全な医療データセットで有効に機能するか?
  • RQ2年齢、性別、認知機能など、異なるメタ特徴に基づく複数のグラフを用いて患者集団をモデル化することで、単一グラフまたは非グラフベースのベースラインと比較して、補完および分類性能がどのように向上するか?
  • RQ3自己注意に基づくマルチグラフ信号統合は、欠損データに対するモデルの汎化性能とロバストネスをどの程度向上させるか?
  • RQ4この文脈において、再帰的GCNに自己回帰的バージョンと比較して非自己回帰的LSTMを使用することで、性能と学習安定性が向上するか?
  • RQ5MGMCは、実世界の神経変性疾患データセットにおいて、補完精度と疾患分類の両面で最先端の手法を上回る性能を示すか?

主な発見

  • MGMCは、低ランク行列補完(LRMC)や潜在的表現学習アプローチを含む最先端手法と比較して、ADNIおよびPPMIデータセットで優れた分類性能を達成する。
  • 特にマルチモーダルかつ高次元のデータ環境下で、再構成中にクラス関連特徴を保持することで、補完精度が顕著に向上する。
  • アブレーションスタディにより、非自己回帰的LSTMと自己注意メカニズムの両方が性能に不可欠であることが確認され、いずれかを除去すると顕著な性能低下が生じる。
  • 複数のメタ特徴に基づくグラフの使用は、単一グラフまたは非グラフベースのベースラインと比較して、より優れた汎化性能とロバストネスをもたらす。
  • MGMCは、2つの異なる神経変性疾患コhortにおいて強力な転送性と汎化性能を示し、今後の不完全データ向けCADxシステムのベースラインとしての可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。