Skip to main content
QUICK REVIEW

[論文レビュー] Variable selection with genetic algorithms using repeated cross-validation of PLS regression models as fitness measure

David Kepplinger, Peter Filzmoser|ArXiv.org|Nov 17, 2017
Spectroscopy and Chemometric Analyses被引用数 3
ひとこと要約

本稿では、変数選択における遺伝的アルゴリズムのための新しいフィットネス評価フレームワークを提案する。偏最小二乗回帰(PLS)モデルの繰り返し交差検証を用いて、内部および外部の予測性能を推定する。交差検証を用いたPLSモデルによる予測精度最適化により、従来のR²ベースの基準と比較して、特に実世界のケモメトリクスデータセットにおいて優れた外部予測性能を示す変数サブセットを同定する。

ABSTRACT

Genetic algorithms are a widely used method in chemometrics for extracting variable subsets with high prediction power. Most fitness measures used by these genetic algorithms are based on the ordinary least-squares fit of the resulting model to the entire data or a subset thereof. Due to multicollinearity, partial least squares regression is often more appropriate, but rarely considered in genetic algorithms due to the additional cost for estimating the optimal number of components. We introduce two novel fitness measures for genetic algorithms, explicitly designed to estimate the internal prediction performance of partial least squares regression models built from the variable subsets. Both measures estimate the optimal number of components using cross-validation and subsequently estimate the prediction performance by predicting the response of observations not included in model-fitting. This is repeated multiple times to estimate the measures' variations due to different random splits. Moreover, one measure was optimized for speed and more accurate estimation of the prediction performance for observations not included during variable selection. This leads to variable subsets with high internal and external prediction power. Results on high-dimensional chemical-analytical data show that the variable subsets acquired by this approach have competitive internal prediction power and superior external prediction power compared to variable subsets extracted with other fitness measures.

研究の動機と目的

  • 従来のケモメトリクス分野における遺伝的アルゴリズムのフィットネス測定法の限界に対処する。特に、通常最小二乗法に依存しており、多重共線性を考慮しない点に起因する。
  • 変数サブセットから構築されたPLS回帰モデルの内部および外部予測性能を正確に推定するフィットネス評価手法を開発する。
  • 交差検証を組み込むことで、高次元の化学的分析データにおける変数選択を向上させ、最適なPLS成分数と予測誤差を推定する。
  • 外部データに一般化できる変数サブセットを優遇することで、QSPRモデルの予測の頑健性を向上させる。

提案手法

  • 本手法は、繰り返し二重交差検証(rdCV)とその簡略化版である単純な繰り返し交差検証(srCV)を、遺伝的アルゴリズムのフィットネス測定に用いる。
  • 各変数サブセットに対して、未知データの予測誤差を最小化するように、交差検証を用いて最適なPLS成分数を推定する。
  • 予測性能は、モデル適合に含まれない観測値の応答を予測することで評価され、複数回のランダムなデータ分割を繰り返すことでばらつきを推定する。
  • srCVバージョンは、テストセットサイズに厳密な制約を課さないことで、計算効率を向上させつつ、外部予測性能の正確な推定を可能にする。
  • フィットネス測定は、単にモデルの適合度ではなく、内部および外部の予測精度が両方高いモデルを優先するように設計されている。
  • 本手法は、CRANに公開されたRパッケージgaselectとして実装されており、ケモメトリクス応用分野への広範なアクセスを可能にしている。

実験結果

リサーチクエスチョン

  • RQ1交差検証を用いたPLS回帰モデルは、従来のR²ベースの基準と比較して、変数選択における遺伝的アルゴリズムのフィットネス測定に、より信頼性の高いものとなるか?
  • RQ2PLS成分の推定に繰り返し交差検証を用いることで、選択された変数サブセットの予測性能にどのような影響を与えるか?
  • RQ3単純化された交差検証アプローチ(srCV)は、繰り返し二重交差検証と比較して、著しく計算時間を短縮しながらも高い精度を維持できるか?
  • RQ4提案されたフィットネス測定法を用いて選択された変数サブセットは、標準的手法に比べて外部予測性能でどの程度優れているか?

主な発見

  • srCVフィットネス測定は、外部予測性能が著しく優れた変数サブセットを生成し、KOCデータセットでは総合RMSEPが0.503を達成した。これは、Gramaticaら(2011)が報告した最良のサブセット(RMSEP 0.532)を上回った。
  • 提案された交差検証ベースのフィットネス測定法を用いて選択された変数サブセットは、R²またはBICベースの基準で選択されたものと比較して、より高い外部予測性能(RMSEP_ext. validation)を示した。
  • srCV手法は、繰り返し二重交差検証と比較して、計算時間を500%以上短縮したが、性能推定の高精度を維持した。
  • 新しいフィットネス測定法を用いて選択されたモデルは、平均的により少ないPLS成分を必要としており、より単純で頑健なモデルであると示された。
  • すべての検証基準がモデルの性能を過大評価していた。訓練データにおけるRMSEPが検証データよりも低かったことから、適切な外部検証の必要性が確認された。
  • 提案手法、特にsrCVは、多重共線性を有する高次元ケモメトリクスデータに適した、一般化能力に優れた変数サブセットの同定を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。