Skip to main content
QUICK REVIEW

[論文レビュー] Kernel methods for in silico chemogenomics

Laurent Jacob, Jean‐Philippe Vert|ArXiv.org|Sep 25, 2007
Computational Drug Discovery Methods参考文献 53被引用数 4
ひとこと要約

本論文は、小分子がタンパク質に結合するのを正確に予測できる、統一された特徴空間でリガンド-ターゲット相互作用を共同でモデル化するカーネルベースの機械学習フレームワークを提案する。特に、既知のリガンドのないターゲットに対しても有効である。ターゲット固有のカーネル(例:階層的または配列ベースの類似性)を活用することで、従来の単一ターゲット手法に比べて、酵素、GPCR、イオンチャネルにおいて顕著に予測精度が向上する。

ABSTRACT

Predicting interactions between small molecules and proteins is a crucial ingredient of the drug discovery process. In particular, accurate predictive models are increasingly used to preselect potential lead compounds from large molecule databases, or to screen for side-effects. While classical in silico approaches focus on predicting interactions with a given specific target, new chemogenomics approaches adopt cross-target views. Building on recent developments in the use of kernel methods in bio- and chemoinformatics, we present a systematic framework to screen the chemical space of small molecules for interaction with the biological space of proteins. We show that this framework allows information sharing across the targets, resulting in a dramatic improvement of ligand prediction accuracy for three important classes of drug targets: enzymes, GPCR and ion channels.

研究の動機と目的

  • 既知のリガンドが限られている、あるいは全くない薬剤ターゲットにおけるリガンド-タンパク質相互作用の予測という課題に取り組むこと。特に、従来のドッキング法やリガンドベースの手法が失敗する状況を想定する。
  • 単一ターゲットモデリングの限界を克服し、リガンドとターゲットの統合的で一貫した表現を用いて、生物学的に関連するターゲット間での情報共有を可能にすること。
  • 分子的およびタンパク質的特徴を組み合わせる、恣意的な共有データの選択や複雑な再重み付け手順を必要としない、体系的でカーネルベースのフレームワークを構築すること。
  • 酵素、GPCR、イオンチャネルといった主要な薬剤ターゲットクラスの予測性能を向上させること。特に、あるターゲットに対して少数または全くリガンドが利用できない低データ環境下での性能向上を目的とする。

提案手法

  • 各リガンド-ターゲットペア $(t, c)$ を、リガンド固有の特徴(例:分子フィンガープint)とターゲット固有の特徴(例:配列または構造的プロファイル)を組み合わせた統合特徴ベクトル $\boldsymbol{\text{Φ}}(t, c)$ で表現する。
  • カーネル法を用いて、統合空間を再生核ヒルバート空間にマップし、リガンド相互作用の可能性を二値分類するためのサポートベクターマシン(SVM)の利用を可能にする。
  • 生物学的知識(例:進化的関係や配列類似性)をエンコードするターゲット固有のカーネル(例:デルタ、階層、マルチタスク、ミスマッチ、ローカルアライメントカーネル)を設計し、ターゲット間での情報転送を可能にする。
  • すべてのターゲットの既知の相互作用ペアを統合的に学習する1つのSVMモデルを訓練し、統合カーネルを用いて類似したターゲット間でデータを暗黙的に共有することで、低データターゲットの一般化性能を向上させる。
  • リガンドとターゲット特徴をカーネル合成によって体系的に組み合わせるアプローチを採用し、手動による共有学習インスタンスの選択や複雑な重み付けスキームの必要性を回避する。
  • 既存の確立された分子グラフ用カーネル(例:ChemCPPから提供)を活用し、それらをターゲットレベルの表現に拡張することで、スケーラビリティと先行研究との互換性を実現する。

実験結果

リサーチクエスチョン

  • RQ1生物学的に関連するターゲット間での情報共有を可能にする統一されたカーネルベースのフレームワークは、多様なタンパク質ターゲットにおいてリガンド予測の精度を向上させることができるか?
  • RQ2ターゲットカーネルの選択(例:階層 vs. デルタ)が、特にリガンドが少ないまたは全くないターゲットの予測性能にどのように影響するか?
  • RQ3リガンドが全く知られていないターゲットに対しても、モデルはどれほど正確にリガンドを予測できるか?また、既知のリガンドがあるターゲットと比較して性能が著しく低下するか?
  • RQ4生物学的階層や配列類似性に基づく構造化されたターゲットカーネルは、単純またはランダムなカーネルに比べて、ターゲット間の機能的関係をより効果的に捉えることができるか?
  • RQ5カーネル法によるリガンドとターゲット空間の統合的モデリングは、手動によるデータ選択やターゲットクラスタリングを必要とする従来のケモジェノミクス手法に代わる体系的でスケーラブルな代替手段を提供できるか?

主な発見

  • リガンドが全くないターゲットに対して、階層カーネルは酵素で $0.862 \times 0.009$、GPCRで $0.776 \times 0.026$、イオンチャネルで $0.805 \times 0.018$ の予測精度を達成し、低データ環境下でも優れた一般化性能を示した。
  • リガンドが全くないターゲットにおいて、階層カーネルは酵素で $1.5\text{ percentage points}$、GPCRで $4.1\text{ points}$、イオンチャネルで $5.2\text{ points}$ の精度低下にとどまり、強力な転送学習性能を示した。
  • リガンドが利用できない状況で、デルタカーネルはすべてのターゲットクラスでランダムレベル($0.500 \times 0.000$)の性能にとどまり、孤立したターゲットデータに依存するモデルが低データ環境で失敗することを確認した。
  • リガンドが少ないターゲットにおいて、階層カーネルはデルタカーネルを最大 $30\text{ percentage points}$ 以上上回る精度を達成し、カーネルに生物学的構造を組み込む利点を示した。
  • 酵素、GPCR、イオンチャネルという3つの主要な薬剤ターゲットファミリーにおいて、構造化されたターゲットカーネルを用いた情報共有を効果的に活用することで、最先端の性能を達成した。
  • ターゲットに既知のリガンドが全くない場合でも、フレームワークは有意義な予測性能(例:イオンチャネルで $0.805 \times 0.018$)を達成しており、未同定のGPCRのようなオーファンターゲットに対しても実現可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。