[論文レビュー] A decision theoretic approach to model evaluation in computational drug discovery
この論文は、計算論的ドラッグディスcoveryにおけるモデル評価のための意思決定理論的アプローチを提案し、分位数に基づくデータ分割とランクベースの損失関数を用いて、外挿性能をよりよく評価する。評価結果から、リッジ回帰のような単純なモデルが、深層ニューラルネットワークやランダムフォレストのような複雑な機械学習手法よりも、高活性分子の予測において優れていることが示された。
Artificial intelligence, trained via machine learning or computational statistics algorithms, holds much promise for the improvement of small molecule drug discovery. However, structure-activity data are high dimensional with low signal-to-noise ratios and proper validation of predictive methods is difficult. It is poorly understood which, if any, of the currently available machine learning algorithms will best predict new candidate drugs. 25 publicly available molecular datasets were extracted from ChEMBL. Neural nets, random forests, support vector machines (regression) and ridge regression were then fitted to the structure-activity data. A new validation method, based on quantile splits on the activity distribution function, is proposed for the construction of training and testing sets. Model validation based on random partitioning of available data favours models which overfit and `memorize' the training set, namely random forests and deep neural nets. Partitioning based on quantiles of the activity distribution correctly penalizes models which can extrapolate onto structurally different molecules outside of the training data. This approach favours more constrained models, namely ridge regression and support vector regression. In addition, our new rank-based loss functions give considerably different results from mean squared error highlighting the necessity to define model optimality with respect to the decision task at hand. Model performance should be evaluated from a decision theoretic perspective with subjective loss functions. Data-splitting based on the separation of high and low activity data provides a robust methodology for determining the best extrapolating model. Simpler, traditional statistical methods such as ridge regression outperform state-of-the-art machine learning methods in this setting.
研究の動機と目的
- 小分子ドラッグディスcoveryにおける機械学習モデルに一般的に見られる過学習と一般化性能の低さの問題を解決すること。
- 構造活性相関(QSAR)モデリングにおける交差検証における標準的なランダム分割の妥当性に疑問を呈すること。
- 現実のドラッグディスCOVERYの目標と整合する意思決定理論的評価フレームワークを提案すること。
- リッジ回帰やサポートベクターレグレッションのような単純で制約のあるモデルが、未知の高活性分子への外挿において、複雑なモデルを上回ることを示すこと。
- 高活性化合物の正確な予測を重視する新しいランクベースの損失関数を導入し、その妥当性を検証すること。
提案手法
- ChEMBLから入手可能な25の公開済み分子データセットを用いてモデル評価を実施。
- 活性分布の分位数に基づく新しいデータ分割戦略を提案し、未知の分子空間への外挿を模擬する。
- この分位数ベースの分割を、交差検証における標準的なランダム分割と比較する。
- 4つのモデルクラスを用いる:ニューラルネットワーク、ランダムフォレスト、サポートベクターマシン(回帰)、リッジ回帰。
- 2つの新しいランクベースの損失関数を導入:$L_{\min}^{\gamma}$(最初の活性分子のランクのみにペナルティを課す)と$L_{\mathrm{sum}}^{\gamma}$(上位の活性分子のランクの合計にペナルティを課す)。
- 平均二乗誤差と新しいランクベースの損失関数を用いてモデルの性能を評価し、ドラッグディスCOVERYにおける意思決定の優先順位を反映する。
実験結果
リサーチクエスチョン
- RQ1交差検証におけるランダム分割は、QSARモデリングにおいてモデル性能の過剰評価を引き起こすか?
- RQ2分位数ベースのデータ分割は、構造的に新しい高活性分子へのモデルの外挿能力をより適切に評価できるか?
- RQ3高活性化合物の予測を重視するランクベースの損失関数は、標準的な平均二乗誤差とは異なるモデル性能ランクをもたらすか?
- RQ4リッジ回帰やサポートベクターレグレッションのような単純で制約のあるモデルは、低信号対ノイズ比で高次元なQSAR設定において、深層ニューラルネットワークのような複雑で柔軟なモデルを上回るか?
- RQ5主観的でタスク固有の損失関数を用いることで、ドラッグディスコーリングにおけるモデル評価が意思決定理論とより整合性を持つようになるか?
主な発見
- 交差検証におけるランダム分割は、訓練データを記憶するような過学習モデル(例:ランダムフォレストや深層ニューラルネットワーク)を好む。
- 分位数ベースの分割は、未知の分子空間への一般化に失敗するモデルをペナルティとして課し、リッジ回帰やサポートベクターレグレッションのような制約のあるモデルを好む。
- リッジ回帰は、最も活性の高い分子の正しいランク付けを重視する$L_{\min}^{\gamma}$損失関数で評価した場合、一貫して他のモデルを上回る性能を示した。
- サポートベクターレグレッションは、上位の活性分子の累積ランク誤差をペナルティとして課す$L_{\mathrm{sum}}^{\gamma}$損失関数で最も優れた性能を示した。
- 損失関数の選択がモデル性能ランクに顕著な影響を及ぼし、平均二乗誤差のような標準的な指標だけではドラッグディスコーリング意思決定に不十分であることが示された。
- ディープラーニングの普及にもかかわらず、提案された分位数分割戦略では、すべての予測能力を失うことが判明し、低信号・高次元のQSARデータにおいて外挿能力が低いことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。