Skip to main content
QUICK REVIEW

[論文レビュー] Hyper-Heuristic Algorithm for Finding Efficient Features in Diagnose of Lung Cancer Disease

Mitra Montazeri, Mahdieh Soleymani Baghshah|arXiv (Cornell University)|Dec 15, 2015
Gene expression and cancer classification参考文献 35被引用数 8
ひとこと要約

本稿では、57の特徴を持つUCI肺がんデータセットを用いて、早期肺がん診断のための効率的特徴を同定するためのハイパーヒューリスティックアルゴリズムを提案する。特徴集合を11に削減することで、80.63%の正確性を達成し、5つの従来の機械学習特徴選択手法を上回り、知的な特徴選択による診断正確性の向上の有効性を示している。

ABSTRACT

Background: Lung cancer was known as primary cancers and the survival rate of cancer is about 15%. Early detection of lung cancer is the leading factor in survival rate. All symptoms (features) of lung cancer do not appear until the cancer spreads to other areas. It needs an accurate early detection of lung cancer, for increasing the survival rate. For accurate detection, it need characterizes efficient features and delete redundancy features among all features. Feature selection is the problem of selecting informative features among all features. Materials and Methods: Lung cancer database consist of 32 patient records with 57 features. This database collected by Hong and Youngand indexed in the University of California Irvine repository. Experimental contents include the extracted from the clinical data and X-ray data, etc. The data described 3 types of pathological lung cancers and all features are taking an integer value 0-3. In our study, new method is proposed for identify efficient features of lung cancer. It is based on Hyper-Heuristic. Results: We obtained an accuracy of 80.63% using reduced 11 feature set. The proposed method compare to the accuracy of 5 machine learning feature selections. The accuracy of these 5 methods are 60.94, 57.81, 68.75, 60.94 and 68.75. Conclusions: The proposed method has better performance with the highest level of accuracy. Therefore, the proposed model is recommended for identifying an efficient symptom of Disease. These finding are very important in health research, particularly in allocation of medical resources for patients who predicted as high-risks

研究の動機と目的

  • 臨床的および画像診断的特徴の多数から、最も情報価値の高い特徴を同定することで、肺がんの早期診断正確性を向上させること。
  • 診断性能を低下させる要因となる特徴の重複やノイズの問題に対処すること。
  • 低レベルのヒューリスティックを動的に選択または生成することで、効率的な特徴部分集合選択を実現するハイパーヒューリスティックアプローチの開発。
  • 肺がんデータセットにおける分類正確性という観点から、既存の機械学習ベースの特徴選択技術を上回ること。
  • 正確で特徴最適化された診断モデルを通じて、高リスク患者の特定により医療リソースの効果的配分を支援すること。

提案手法

  • 提案手法は、従来のヒューリスティックよりも高いレベルで動作するハイパーヒューリスティックフレームワークを採用し、特徴選択のための低レベルのヒューリスティックを選択または生成する。
  • 分類性能への寄与に基づいて、繰り返し特徴を選択または削除するための事前に定義された低レベルのヒューリスティックの集合を用いる。
  • 分類器(C4.5やk-NNなどの標準的な学習器と想定される)を用いて特徴部分集合を評価し、最適な部分集合の探索をガイドする。
  • 分類正確性に基づくフィットネス関数を用いて探索をガイドし、特徴数を最小限に抑えながら性能を最大化することを目的とする。
  • 全可能な部分集合を全検索するのを避けるために、特徴空間を効率的に探索するための局所探索戦略を適用する。
  • UCI肺がんデータセット上で、探索中に達成された最高の分類正確性に基づいて、最終的な特徴部分集合が選択される。

実験結果

リサーチクエスチョン

  • RQ1ハイパーヒューリスティックアプローチは、従来の機械学習手法を上回って、肺がん診断のための効率的特徴選択を実現できるか?
  • RQ2肺がん検出において高い診断正確性を達成するために必要な最適な特徴数は何か?
  • RQ3提案されたハイパーヒューリスティック手法は、ベースラインの特徴選択技術と比較して、どのように冗長性を低減し、分類性能を向上させるか?
  • RQ4特徴削減は、肺がん診断モデルの正確性と信頼性にどの程度影響を与えるか?
  • RQ5限られたサンプル数と高次元特徴を有する医療データセットに対し、ハイパーヒューリスティックフレームワークは効果的に適用可能か?

主な発見

  • 提案されたハイパーヒューリスティック手法は、わずか11の特徴を用いて80.63%の分類正確性を達成し、5つの従来の特徴選択手法を顕著に上回った。
  • 5つのベースライン手法は、それぞれ60.94%、57.81%、68.75%、60.94%、68.75%の正確性を達成し、提案手法の優位性を裏付けた。
  • この手法は、元の57特徴のデータセットを、最小限でありながらも非常に情報価値の高い11特徴の部分集合に削減し、モデルの効率性と解釈可能性を向上させた。
  • 結果から、ハイパラヒューリスティクスによる知的な特徴選択が診断正確性を向上させることを示しており、肺がんの早期発見を支援することが明らかになった。
  • 本研究は、特徴選択が早期かつ正確な診断を可能にすることで生存率の向上に寄与することの重要性を確認した。
  • モデルのパフォーマンスは、高リスク患者のリスク分類および医療リソース配分への臨床的適用の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。