Skip to main content
QUICK REVIEW

[論文レビュー] Fuzzy Gene Selection and Cancer Classification Based on Deep Learning Model

Mahmood Khalsan, Mu Mu|arXiv (Cornell University)|May 4, 2023
Gene expression and cancer classification被引用数 5
ひとこと要約

本稿では、高次元の遺伝子発現データからのがん分類を向上させるために、マルチレイヤーパーセプトロン(MLP)ディープラーニングモデルと統合された新規なファジィ遺伝子選択(FGS)手法を提案する。相互情報量、F-ClassIf、カイ二乗スコアをファジィ化およびデファジィフィケーションを用いて統合することで、FGSは重要な遺伝子を特定し、次元削減を実現するとともに分類器の性能を向上させる。6つのデータセットで96.5%の正確性、96.2%の適合率、96%の再現率、95.9%のF1スコアを達成し、遺伝子選択なしの標準的MLPよりも顕著に優れた性能を示した。

ABSTRACT

Machine learning (ML) approaches have been used to develop highly accurate and efficient applications in many fields including bio-medical science. However, even with advanced ML techniques, cancer classification using gene expression data is still complicated because of the high dimensionality of the datasets employed. We developed a new fuzzy gene selection technique (FGS) to identify informative genes to facilitate cancer classification and reduce the dimensionality of the available gene expression data. Three feature selection methods (Mutual Information, F-ClassIf, and Chi-squared) were evaluated and employed to obtain the score and rank for each gene. Then, using Fuzzification and Defuzzification methods to obtain the best single score for each gene, which aids in the identification of significant genes. Our study applied the fuzzy measures to six gene expression datasets including four Microarray and two RNA-seq datasets for evaluating the proposed algorithm. With our FGS-enhanced method, the cancer classification model achieved 96.5%,96.2%,96%, and 95.9% for accuracy, precision, recall, and f1-score respectively, which is significantly higher than 69.2% accuracy, 57.8% precision, 66% recall, and 58.2% f1-score when the standard MLP method was used. In examining the six datasets that were used, the proposed model demonstrates it's capacity to classify cancer effectively.

研究の動機と目的

  • 高次元の遺伝子発現データはモデルの性能を低下させるとともに学習時間を増加させるため、がん分類におけるその課題に対処すること。
  • 過学習を軽減し、学習効率を向上させるために、最も情報量の多い遺伝子のみを選択することでデータセットの次元を低減すること。
  • 複数の特徴スコアリング手法を統合したファジィベースの遺伝子選択フレームワークを構築し、遺伝子ランク付けおよび選択の正確性を向上させること。
  • 最適化された遺伝子サブセット選択を通じて、特にMLPのようなディープラーニング分類器の遺伝子発現データに対する性能を向上させること。
  • 今後の実験的検証やがんの早期診断における研究に向けた生物学的に解釈可能な候補遺伝子のセットを提供すること。

提案手法

  • 6つの遺伝子発現データセットにおいて、それぞれの遺伝子について、相互情報量、F-ClassIf、カイ二乗スコアの3つの特徴選択手法を適用し、初期スコアとランクを算出する。
  • クリップド特徴スコアをファジィ所属度に変換することで、不確実性を捉え、遺伝子ランク付けのロバスト性を向上させる。
  • 重心法(例:中心の重み)などのデファジィフィケーション技術を適用し、各遺伝子に対して一意の統合ファジィスコアを導出することで、明確な遺伝子優先順位付けを可能にする。
  • FGSプロセスで上位にランク付けされた遺伝子を、マルチレイヤーパーセプトロン(MLP)分類器の入力特徴として統合し、がん分類を実行する。
  • GEOおよびTCGAリポジトリから得た4つのマイクロアレイおよび2つのRNA-seqデータセットを用い、5-fold交差検証によりFGS-MLPモデルを学習および評価する。
  • 標準的なディープラーニングハイパーパrameterを用いてモデルを最適化し、正確性、適合率、再現率、F1スコアなどの指標を用いて性能を検証する。
Figure 1: Illustration example of distributed Features to show up F-classif work
Figure 1: Illustration example of distributed Features to show up F-classif work

実験結果

リサーチクエスチョン

  • RQ1ファジィベースの遺伝子選択手法は、分類に関連する特徴を保持しつつ、高次元の遺伝子発現データの次元を効果的に低減できるか?
  • RQ2MLPのようなディープラーニング分類器とFGSを統合することで、遺伝子選択なしの標準的MLPに比べ、がん分類性能がどのように向上するか?
  • RQ3FGSは、遺伝子発現データに基づくがん分類モデルの過学習および学習時間をどの程度軽減するか?
  • RQ4ファジィ論理を用いて統合された際、相互情報量、F-ClassIf、カイ二乗スコアのどの組み合わせが、最もロバストで一貫性のある遺伝子ランク付けをもたらすか?
  • RQ5FGSプロセスで選択された遺伝子は、がん病態発症に関する今後の実験的検証に向けた生物学的に意味のあるバイオマーカーとして機能できるか?

主な発見

  • FGS-MLPモデルは6つの遺伝子発現データセットで平均96.5%の正確性を達成し、遺伝子選択なしの標準的MLP(69.2%)を顕著に上回った。
  • FGSを用いることで適合率は96.2%、再現率は96%、F1スコアは95.9%に向上したのに対し、無選択の場合はそれぞれ57.8%、66%、58.2%にとどまり、顕著な性能向上が確認された。
  • FGS手法により入力遺伝子数が最小限かつ生物学的に関連性のあるセットにまで削減され、学習時間の短縮と過学習リスクの低減が実現された。
  • MLPはFGSと組み合わせることで正確性が27.3%上昇し、本手法の遺伝子選択アプローチと強い相性を示した。
  • 個々のデータセットでは分類正確性が93%から99%の範囲に分布し、特に甲状腺がんデータセットGSE33630で最高の正確性(99%)を記録した。
  • FGSで選択された遺伝子は生物学的に妥当であり、がん研究や早期診断における今後の実験的検証のための候補バイオマーカーとして利用可能である。
Figure 2: Block Diagram of Proposed Fuzzy Gene selection Process
Figure 2: Block Diagram of Proposed Fuzzy Gene selection Process

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。