[論文レビュー] Best practices for constructing, preparing, and evaluating protein-ligand binding affinity benchmarks
本論文は、自由エネルギー計算を用いたタンパク質-リガンド結合親和性ベンチマークの構築、準備、評価のための標準化されたベストプラクティスを確立する。自由エネルギー計算手法およびドラッグディスcovery分野における新興の機械学習的手法の両方に広く適用可能な、バージョン管理されたベンチマークセット(protein-ligand-benchmark)とオープンソースのツールキット(openff-arsenic)を提供し、高品質で再現可能で統計的に信頼性の高い計算手法の評価を実現する。
Free energy calculations are rapidly becoming indispensable in structure-enabled drug discovery programs. As new methods, force fields, and implementations are developed, assessing their expected accuracy on real-world systems (benchmarking) becomes critical to provide users with an assessment of the accuracy expected when these methods are applied within their domain of applicability, and developers with a way to assess the expected impact of new methodologies. These assessments require construction of a benchmark - a set of well-prepared, high quality systems with corresponding experimental measurements designed to ensure the resulting calculations provide a realistic assessment of expected performance when these methods are deployed within their domains of applicability. To date, the community has not yet adopted a common standardized benchmark, and existing benchmark reports suffer from a myriad of issues, including poor data quality, limited statistical power, and statistically deficient analyses, all of which can conspire to produce benchmarks that are poorly predictive of real-world performance. Here, we address these issues by presenting guidelines for (1) curating experimental data to develop meaningful benchmark sets, (2) preparing benchmark inputs according to best practices to facilitate widespread adoption, and (3) analysis of the resulting predictions to enable statistically meaningful comparisons among methods and force fields.
研究の動機と目的
- タンパク質-リガンド結合親和性予測のための標準化され、高品質なベンチマークが不足しているという問題に対処すること。
- データキュレーション、構造準備、統計的分析のベストプラクティスを定義することで、計算ドラッグディスcoveryにおけるベンチマークの信頼性と再現可能性を向上させること。
- コミュニティが採用可能なバージョン管理されたベンチマークデータセットとオープンソースのツールキットを提供し、自由エネルギー手法の一貫性のある評価を可能にすること。
- 標準化されたデータ収集およびキュレーションプロトコルを通じて、ベンチマークデータセットの体系的改善を支援すること。
提案手法
- 高品質な実験データから構成され、構造的およびバイオアクティビティ情報が付与された、標準化され、バージョン管理されたベンチマークセット(protein-ligand-benchmark)をキュレーションする。
- 実験データキュレーションのベストプラクティスを確立し、Iridium MT/HT分類やバイオフィジカルアッセイの出典など、最低限のデータ品質基準を含む。
- 正確なプロトン化状態、トランスフェルミック状態、および電荷状態を保証するための、専門家レビューによる検証済みの構造準備プロトコルを提供する。
- ブートストラップ法を用いた信頼区間と、RMSE や MUE といった適切な指標を含む、ベンチマーク評価の統計フレームワークを導入する。
- 自由エネルギー計算の評価を、異なる手法や力場 across で標準化・自動化するためのオープンソースツールキット(openff-arsenic)を開発する。
- 一貫性のある可視化およびレポート作成の実践を推奨する。例えば、計算値と実験値の親和性を、同じ単位とスケールでプロットすること。
実験結果
リサーチクエスチョン
- RQ1タンパク質-リガンド結合親和性予測のための高品質で信頼性の高いベンチマークデータセットを定義する基準は何ですか?
- RQ2バイアスを最小限に抑え、ベンチマーク評価における統計的妥当性を確保するために、実験データをどのようにキュレーションすればよいですか?
- RQ3自由エネルギー計算における一貫性と正確性を保証するための最適な構造準備プロトコルは何か?
- RQ4異なる手法や力場間での有効で再現可能な比較を可能にするために、ベンチマーク結果をどのように統計的に分析すべきですか?
- RQ5計算ドラッグディスcoveryコミュニティ全体で標準化できる、オープンでバージョン管理され、コミュニティが維持するリソースは何か?
主な発見
- ベンチマークセットには、1ターゲットあたり少なくとも16のリガンド(理想的には25以上)が含まれ、自由エネルギーの範囲が少なくとも3.0 kcal/mol(理想的には5.0 kcal/mol以上)であることが求められ、意味のある評価に十分なダイナミックレンジを確保する。
- 高品質な実験データはバイオフィジカルアッセイから取得され、Iridium MT や HT に分類される必要があり、信頼性と再現性を確保する。
- 構造準備には、プロトン化状態、トランスフェルミック状態、電荷状態の専門家による検証が不可欠であり、自由エネルギー予測における系統的誤差を防ぐ。
- 統計的分析には、すべての性能指標に対してブートストラップ法を用いた信頼区間を含める必要があり、結果の過剰解釈を回避する。
- オープンソースのツールキット openff-arsenic により、異なる手法や力場 across で自由エネルギー計算の評価を標準化・再現可能にする。
- 提案されたフレームワークは、後向きのベンチマーク評価と前向きのチャレンジの両方を支援し、実世界の応用におけるベンチマークの予測力の向上を実現する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。