Skip to main content
QUICK REVIEW

[論文レビュー] A New Heuristic for Feature Selection by Consistent Biclustering

Antonio Mucherino, Sonia Cafieri|arXiv (Cornell University)|Mar 17, 2010
Rough Sets and Fuzzy Logic参考文献 12被引用数 3
ひとこと要約

本稿では、一貫性のあるバイクラスタリングを介した特徴選択のための新しい二段階最適化ヒューリスティクスを提案する。これは、NP困難な0–1線形分数計画問題を再定式化することで、解の品質を向上させるものである。この手法は、白血病および合成データセットにおいて、分類誤差を低く保ちながらより多くの特徴を選択することで、先行するヒューリスティクスを上回り、妥当性データでたった2件の誤分類で最大7,081個の特徴を選択した。

ABSTRACT

Given a set of data, biclustering aims at finding simultaneous partitions in biclusters of its samples and of the features which are used for representing the samples. Consistent biclusterings allow to obtain correct classifications of the samples from the known classification of the features, and vice versa, and they are very useful for performing supervised classifications. The problem of finding consistent biclusterings can be seen as a feature selection problem, where the features that are not relevant for classification purposes are removed from the set of data, while the total number of features is maximized in order to preserve information. This feature selection problem can be formulated as a linear fractional 0-1 optimization problem. We propose a reformulation of this problem as a bilevel optimization problem, and we present a heuristic algorithm for an efficient solution of the reformulated problem. Computational experiments show that the presented algorithm is able to find better solutions with respect to the ones obtained by employing previously presented heuristic algorithms.

研究の動機と目的

  • 一貫性のあるバイクラスタリングにおけるNP困難な特徴選択問題に対処すること。ここでは、関係のない特徴が分類精度を低下させる。
  • 0–1線形分数計画最適化問題を二段階計画問題に再定式化することで、より効果的なヒューリスティクス解法を可能にすること。
  • 分類精度を維持しながら選択された特徴数を最大化し、サンプルと特徴のクラスタリングの整合性を保証すること。
  • 特に急性白血病データセットを含む実世界の遺伝子発現データに対して、提案されたヒューリスティクスを検証し、別個の妥当性セットを用いて性能を評価すること。

提案手法

  • 元の0–1線形分数計画特徴選択問題を、内側に線形計画問題を含む二段階最適化問題に再定式化する。
  • 外側のヒューリスティクスの各反復において、内側問題の連続緩和問題を決定的アルゴリズムで正確に解く。
  • 整合性制約の下で目的関数を改善する特徴を段階的に選択するためのグリーディ戦略を適用する。
  • 2種類の緩和整合性を導入する:α-整合性およびβ-整合性バイクラスタリングであり、特徴数と分類精度のトレードオフを許容する。
  • 妥当性セットを用いて分類性能を評価し、未観測のサンプルにおける誤分類誤差を測定する。
  • αおよびβパラメータのチューニングにより、特徴選択のサイズと分類品質のバランスを取るヒューリスティクスを実装する。

実験結果

リサーチクエスチョン

  • RQ1既存のヒューリスティクスと比較して、二段階最適化の再定式化は、一貫性のあるバイクラスタリングにおける特徴選択の品質を向上させるか?
  • RQ2提案されたヒューリスティクスは、実際の白血病遺伝子発現データにおいて、特徴数と分類精度の両面でどの程度の性能を示すか?
  • RQ3αおよびβパラメータを変化させた場合、妥当性セットにおける選択された特徴数と誤分類数にどのような影響を与えるか?
  • RQ4提案手法は、関連する特徴数を最大化する一方で、サンプルと特徴のクラスタリングの整合性を維持できるか?
  • RQ5決定的手法が非現実的となるような大規模データセットに対しても、このヒューリスティクスは効率的に処理できるか?

主な発見

  • α = 0 または β = 1.00 の場合、白血病妥当性セットでたった2件の誤分類で7,081個の特徴が選択された。これは、先行ヒューリスティクスが7,024個の特徴を同じ誤分類率で選択したのと比較して優れている。
  • α ≥ 50 の場合、妥当性セットで誤分類が1件にまで減少し、ノイズにさらされても高いロバストネスを示した。
  • ほとんどのαおよびβの値において、本手法は先行ヒューリスティクスよりも常に多くの特徴を選択したが、α = 70 の場合を除き、本手法は6,989個の特徴を、先行手法は7,046個を選択した。
  • αまたはβの値が高くなるにつれて、選択された特徴数は減少し、整合性の強度と特徴数のトレードオフが明確に表れた。
  • 計算コストはαまたはβが高くなるにつれて増加し、一部の実験では数分間のCPU時間が必要となった。これは、高い整合性閾値におけるスケーラビリティの課題を示している。
  • 合成データでは、α-整合性下で7,500個の特徴を含むデータセットから7,450個の特徴を正しく同定できた。これは、理想状態下で高い特徴保持率を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。