[論文レビュー] How Many Genes Are Needed for a Discriminant Microarray Data Analysis ?
本研究では、白血病データセット(38サンプル、7129遺伝子)を用いて、マイクロアレイデータにおける効果的な判別分析に必要な最小遺伝子数を調査した。AICおよびBICを用いたモデル選択の結果、最適なのは1–2遺伝子(特に遺伝子#4847、zyxin)であり、等重みまたは尤度に基づく重みのモデル平均化では、10–25遺伝子を超えると利得が減少する。これは、強い個別予測子と小標本サイズのため、過去の研究で用いられた50遺伝子はこのデータセットでは過剰であることを示唆している。
The analysis of the leukemia data from Whitehead/MIT group is a discriminant analysis (also called a supervised learning). Among thousands of genes whose expression levels are measured, not all are needed for discriminant analysis: a gene may either not contribute to the separation of two types of tissues/cancers, or it may be redundant because it is highly correlated with other genes. There are two theoretical frameworks in which variable selection (or gene selection in our case) can be addressed. The first is model selection, and the second is model averaging. We have carried out model selection using Akaike information criterion and Bayesian information criterion with logistic regression (discrimination, prediction, or classification) to determine the number of genes that provide the best model. These model selection criteria set upper limits of 22-25 and 12-13 genes for this data set with 38 samples, and the best model consists of only one (no.4847, zyxin) or two genes. We have also carried out model averaging over the best single-gene logistic predictors using three different weights: maximized likelihood, prediction rate on training set, and equal weight. We have observed that the performance of most of these weighted predictors on the testing set is gradually reduced as more genes are included, but a clear cutoff that separates good and bad prediction performance is not found.
研究の動機と目的
- 限られたサンプルサイズにおけるマイクロアレイデータの正確な判別分析に必要な最小遺伝子数を特定すること。
- 過去の白血病分類研究で用いられた50遺伝子が、このデータセットにおいて必要か過剰であるかを評価すること。
- 分類の遺伝子サブセット選択において、モデル選択(AIC/BIC)とモデル平均化のアプローチを比較すること。
- 遺伝子の重複性と強い個別予測子が、モデルの複雑さと性能に与える影響を評価すること。
提案手法
- ロジスティック回帰モデルにおける最適な遺伝子数を特定するため、AICおよびBICによるモデル選択。
- ステップワイズ変数選択を用いて、遺伝子サブセットの性能を評価。
- 3つの重み付け方式(最大尤度、トレーニングセットの予測率、等重み)を用いたモデル平均化。
- トレーニングセットおよび独立したテストセットにおける予測性能の評価。
- モデルの寄与度を反映するために、有効な遺伝子数を計算。
- 分類にロジスティック回帰を用い、P(AML) = 1 / (1 + exp(−a₀ − Σaⱼxⱼ)) と定式化。ここで遺伝子発現量xⱼが予測変数となる。
実験結果
リサーチクエスチョン
- RQ138サンプルしかないWhitehead/MIT白血病マイクロアレイデータセットにおいて、判別分析に必要な最適な遺伝子数は何か?
- RQ2過去の分類研究で用いられた50遺伝子は、この小標本設定において過学習を引き起こすのか、それとも必要なロバストネスを提供するのか?
- RQ3AICおよびBICによるモデル選択基準は、分類に最適な遺伝子サブセットを特定する上で、どのように比較されるか?
- RQ4複数遺伝子を用いたモデル平均化は、単一遺伝子モデルを上回る予測性能を達成できるか?
- RQ5モデル平均化において、数個を超える遺伝子を含める際に、明確な性能のしきい値があるか?
主な発見
- AICおよびBICによるモデル選択では、最適なモデルが1–2遺伝子で構成され、特に遺伝子#4847(zyxin)がトレーニングセットで完全分類を達成している。
- 最良の単一遺伝子モデル(遺伝子#4847)は、トレーニングセットで36/38、テストセットで36/38の予測率を示し、優れた一般化性能を示している。
- モデル平均化において25遺伝子以上を含めると、テストセットでの性能が低下し、明確なしきい値は見られないが、一貫した予測精度の低下が観察された。
- 最大尤度重み方式におけるモデル平均化は、上位遺伝子の支配的影響により、実質的に単一遺伝子モデルに帰着し、上位10遺伝子においても有効な遺伝子数はわずか1.05にとどまった。
- 等重みおよび予測率に基づくモデル平均化では類似した性能を示したが、10–20遺伝子を超えると両者ともテストセットでの性能が劣化した。
- 本研究では、強い個別予測子と小標本サイズのため、50遺伝子はこのデータセットにおいて過剰であり、より大きな遺伝子セットは過学習の原因となり、むしろ有害であると結論づけた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。