Skip to main content
QUICK REVIEW

[論文レビュー] A Stable Combinatorial Particle Swarm Optimization for Scalable Feature Selection in Gene Expression Data

Hassen Dhrif, Luis G. Sánchez Giraldo|arXiv (Cornell University)|Jan 24, 2019
Metaheuristic Optimization Algorithms Research参考文献 38被引用数 7
ひとこと要約

本稿では、高次元の遺伝子発現データにおける特徴選択のための安定性、多様性、スケーラビリティを向上させる、新しい組み合わせ的粒子群最適化(COMB-PSO)アルゴリズムを提案する。連続空間での符号化、適応的慣性係数および加速係数、動的集団戦略、乱流作用素を用いることで、標準的なPSOの変種よりも小さな、高精度な遺伝子サブセットを同定する。実がんデータセットにおいて、BPSOおよびMOPSOを著しく上回る性能を示す。

ABSTRACT

Evolutionary computation (EC) algorithms, such as discrete and multi-objective versions of particle swarm optimization (PSO), have been applied to solve the Feature selection (FS) problem, tackling the combinatorial explosion of search spaces that are peppered with local minima. Furthermore, high-dimensional FS problems such as finding a small set of biomarkers to make a diagnostic call add an additional challenge as such methods ability to pick out the most important features must remain unchanged in decision spaces of increasing dimensions and presence of irrelevant features. We developed a combinatorial PSO algorithm, called COMB-PSO, that scales up to high-dimensional gene expression data while still selecting the smallest subsets of genes that allow reliable classification of samples. In particular, COMB-PSO enhances the encoding, speed of convergence, control of divergence and diversity of the conventional PSO algorithm, balancing exploration and exploitation of the search space. Applying our approach on real gene expression data of different cancers, COMB-PSO finds gene sets of smallest size that allow a reliable classification of the underlying disease classes.

研究の動機と目的

  • 遺伝子発現データの高次元特徴選択において、標準的なPSOの不安定さと早期収束を解消すること。
  • 低サンプル数、高特徴数のデータセットにおいて、分類精度を維持しながら選択された遺伝子サブセットのサイズを小さくすること。
  • 組み合わせ的探索空間における探索と活用のバランスを高め、集団の多様性を向上させること。
  • 不要な特徴が特徴空間に追加された場合のスケーラビリティとロバストネスを保証すること。
  • 既存の離散的および多目的PSO手法を凌駕する安定的かつスケーラブルなPSOの変種を開発すること。

提案手法

  • 粒子の位置を確率にマッピングする連続空間符号化方式を導入し、連続的PSOのダイナミクスを保持するとともに、探索能力を向上させる。
  • 位置と速度に基づく適応的慣性重みおよび加速係数を採用し、探索と活用の動的バランスを図る。
  • 収束を加速し、グローバルベストの発見を向上させるために、動的集団戦略を適用する。
  • 局所最適解からの脱出と多様性の向上を図るために、乱流作用素を組み込む。
  • 非ゼロビット数が少ない解に偏るよう、非対称な位置境界を用いて粒子を制約する。
  • 多目的変種では、集団の整合性を維持するためのローカルリーダー選択メカニズムと、類似度に基づく多様性メカニズムを導入し、非支配解を保存する。

実験結果

リサーチクエスチョン

  • RQ1不要な特徴が高次元の遺伝子発現データに追加された場合、修正されたPSOアルゴリズムは安定的かつ小さな特徴サブセットサイズを維持できるか?
  • RQ2実がんデータセットにおいて、COMB-PSOは標準的なBPSOおよびMOPSOと比較して、サブセットサイズ、分類精度、収束速度の点でどのように異なるか?
  • RQ3連続空間符号化と適応的パラメータ制御は、組み合わせ的特徴選択において探索の多様性と収束性をどの程度向上させるか?
  • RQ4多目的版のCOMB-PSOは、単目的版と比較してより小さな、より正確な遺伝子サブセットを生成するか?
  • RQ5COMB-PSOは、数万の特徴と数百のサンプルを含むデータセットに対しても、どの程度スケーラブルか?

主な発見

  • COMB-PSOは、3つの実際の遺伝子発現データセットにおいて、標準的なBPSOおよびMOPSOを著しく上回り、より小さな遺伝子サブセットを同定し、分類誤差率を低く抑える。
  • COMB-PSOの多目的版は、単目的版と比較してより小さな特徴サブセットを生成するが、分類精度は同等を維持する。
  • 合成データセットでは、不要な特徴の数が増加しても、COMB-PSOは安定したサブセットサイズを維持し、高次元ノイズに対してロバストであることが示された。
  • Leukemia2、Prostate tumor、B-cell lymphomaデータセットでの検証により、最小限の特徴セットで高い分類精度を達成した。
  • 誤差率および強く関連する特徴のカバー率において、SO-COMB-PSOとMO-COMB-PSOは類似した性能を示すが、サブセットサイズではMO-COMB-PSOがよりコンactな解を生成する。
  • 超大規模データセットでは、計算コストが依然として高く、スケーラビリティのさらなる最適化が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。