Skip to main content
QUICK REVIEW

[論文レビュー] ECO-AMLP: A Decision Support System using an Enhanced Class Outlier with Automatic Multilayer Perceptron for Diabetes Prediction

Maham Jahangir, Hammad Afzal|arXiv (Cornell University)|Jun 23, 2017
Artificial Intelligence in Healthcare参考文献 50被引用数 4
ひとこと要約

本論文では、Enhanced Class Outlier Detection (ECODB) と AutoMLP を統合したハイブリッド意思決定支援システム ECO-AMLP を提案し、糖尿病予測の精度を向上させることを目的としている。距離に基づくクラス外れ要因を用いて外れ値を除去し、自動チューニングされた多層パーセプトロンのアンサンブルを適用することで、Pima Indian Diabetes Dataset において 88.7% の精度を達成した。これは、これまでに報告されたあらゆる手法を上回る結果である。

ABSTRACT

With advanced data analytical techniques, efforts for more accurate decision support systems for disease prediction are on rise. Surveys by World Health Organization (WHO) indicate a great increase in number of diabetic patients and related deaths each year. Early diagnosis of diabetes is a major concern among researchers and practitioners. The paper presents an application of extit{Automatic Multilayer Perceptron }which extit{ }is combined with an outlier detection method extit{Enhanced Class Outlier Detection using distance based algorithm }to create a prediction framework named as Enhanced Class Outlier with Automatic Multi layer Perceptron (ECO-AMLP). A series of experiments are performed on publicly available Pima Indian Diabetes Dataset to compare ECO-AMLP with other individual classifiers as well as ensemble based methods. The outlier technique used in our framework gave better results as compared to other pre-processing and classification techniques. Finally, the results are compared with other state-of-the-art methods reported in literature for diabetes prediction on PIDD and achieved accuracy of 88.7\% bests all other reported studies.

研究の動機と目的

  • ロバストな前処理と高度な機械学習を統合することで、糖尿病予測システムにおける低精度の課題に対処すること。
  • AutoMLP と呼ばれる自動チューニング可能な多層パーセプトロンのアンサンブルを用いることで、ニューラルネットワークにおける手動によるハイパーパrameterチューニングへの依存度を低減すること。
  • 新規の距離に基づくクラス外れ検出法を用いてトレーニングの前にデータ外れ値を除去することで、モデル性能を向上させること。
  • ベンチマーク用の Pima Indian Diabetes Dataset (PIDD) において、既存の最先端手法を上回ること。
  • 提案されたフレームワークを用いて、糖尿病の予測に最も寄与する特徴量を同定すること。

提案手法

  • ECODB は、確率、偏差、および K 個の近隣距離を用いてクラス外れ要因を計算する距離に基づく外れ値検出技術であり、データセットからの外れ値の特定および削除を実行する。
  • 前処理済みデータは、隠れ層、ニューロン数、学習率、エポック数を含むネットワークトポロジーを自動的にチューニングする 4 つの多層パーセプトロンのアンサンブルである AutoMLP に供給される。
  • ECODB 前処理と AutoMLP 分類を統合することで、糖尿病予測のためのハイブリッド意思決定支援システム ECO-AMLP を構築する。
  • Pima Indian Diabetes Dataset (PIDD) を用いて、標準指標(精度、加重平均適合率(WMP)、加重平均再現率(WMR))を用いて性能を評価する。
  • KNN やナイーブベイズ、SVM などの個々の分類器、Bagging や AdaBoost などのアンサンブル手法、さまざまな ANN アーキテクチャと本手法を比較する。
  • 特徴量の重要度を分析し、血漿グルコース濃度、拡張血圧、出産回数などの主要な予測要因を同定する。

実験結果

リサーチクエスチョン

  • RQ1外れ値検出と自動チューニングされたニューラルネットワークを統合したハイブリッドフレームワークは、既存の手法を上回る糖尿病予測精度を達成できるか?
  • RQ2ECODB 前処理は、正規化、特徴選択、サンプリングといった従来の技術と比較して、モデル性能の向上にどの程度優れているか?
  • RQ3AutoMLP は糖尿病予測タスクにおいて、個々のニューラルネットワークアーキテクチャを常に上回る性能を示すか?
  • RQ4ECO-AMLP フレームワークによると、どの臨床的特徴量が糖尿病予測において最も予測的か?
  • RQ5Pima Indian Diabetes Dataset において、ECO-AMLP は精度、適合率、再現率の観点から最先端のアプローチと比較してどう異なるか?

主な発見

  • ECO-AMLP は、Pima Indian Diabetes Dataset において 88.7% の精度を達成した。これは、このベンチマークデータセットにおいて、これまでに報告された中で最高の精度である。
  • ECODB 外れ値検出法は、正規化、特徴選択、属性重み付け、サンプリング技術よりも、モデル性能の向上に優れていた。
  • AutoMLP は、標準 MLP、RBF ネットワーク、パーセプトロンを含む個々のニューラルネットワークアーキテクチャと比較して優れた性能を示した。
  • フレームワークは加重平均再現率 88.56% および加重平均適合率 85.83% を達成し、感度と適合率の両立が図れていることが示された。
  • 血漿グルコース濃度、拡張血圧、出産回数が、糖尿病予測において最も関連性の高い特徴量として同定された。
  • ECO-AMLP は、複素数型ニューラルネットワーク、ニューロファジィシステム、メタラーナーなど、複雑なアーキテクチャを含む、これまでに報告されたすべての手法を精度および頑健性の観点で上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。