[論文レビュー] Partial Product Aware Machine Learning on DNA-Encoded Libraries
本論文は、DNAエンコーディングライブラリ(DELs)における部分生成物と反応収率を明示的に考慮するグラフニューラルネットワーク(GNN)ベースの機械学習モデルを提案し、予測精度と一般化性能を向上させた。実験的に測定された収率を用いて全生成物および部分生成物の割合をモデル化することで、三成分体(trisynthons)のみを用いるか、一定収率を仮定するモデルよりも優れた性能を示し、特に外部化合物のバーチャルスクリーニングにおいて顕著な改善が得られた。
DNA encoded libraries (DELs) are used for rapid large-scale screening of small molecules against a protein target. These combinatorial libraries are built through several cycles of chemistry and DNA ligation, producing large sets of DNA-tagged molecules. Training machine learning models on DEL data has been shown to be effective at predicting molecules of interest dissimilar from those in the original DEL. Machine learning chemical property prediction approaches rely on the assumption that the property of interest is linked to a single chemical structure. In the context of DNA-encoded libraries, this is equivalent to assuming that every chemical reaction fully yields the desired product. However, in practice, multi-step chemical synthesis sometimes generates partial molecules. Each unique DNA tag in a DEL therefore corresponds to a set of possible molecules. Here, we leverage reaction yield data to enumerate the set of possible molecules corresponding to a given DNA tag. This paper demonstrates that training a custom GNN on this richer dataset improves accuracy and generalization performance.
研究の動機と目的
- 既存のMLモデルが完全な反応収率を仮定し、部分生成物を無視するという限界を是正すること。
- DELsにおける全生成物(三成分体)と部分生成物(二成分体、一成分体)の両方をモデル化することで、予測精度と一般化性能を向上させること。
- 一定収率を仮定するのではなく、実験的に測定された反応収率を活用することで、分子混合物の割合をより正確に表現すること。
- 外部ベンダー化合物を用いたバーチャルスクリーニングを通じて、モデルの実世界への一般化能力を評価すること。
提案手法
- モデルは、分子構造に基づき、全生成物(三成分体)および部分生成物(二成分体、一成分体)の両方の豊度スコアを1つのGNNで予測する。
- バリデーション実験から得られた反応収率データを活用し、各DNAバーコードごとの各生成物タイプの割合を推定する。
- 損失関数は、ターゲットとノーターゲットコントロール(NTC)のカウントをネガティブバイノミアル尤度で統合し、豊度の二乗値に正則化項を適用する。
- モデルは、ラボでの精製プロセスに伴うノイズに対応するため、生成物割合の調整を学習段階で行う。
- 各生成物タイプの豊度スコアをDNAバーコードごとに集約し、最終的なシークエンシングリードカウントを予測する。
- モデルは内部DELデータで学習し、ホールドアウトされたテストセットおよび150種のベンダー化合物から成る外部データセットで評価する。
実験結果
リサーチクエスチョン
- RQ1DNAエンコーディングライブラリにおいて部分生成物をモデル化することで、全生成物のみを考慮するモデルと比較して、機械学習の予測精度が向上するか?
- RQ2一定収率を仮定するのではなく、実験的に測定された収率を用いることで、外部化合物に対するモデルの一般化性能が向上するか?
- RQ3二成分体生成物の取り入れが、DELデータにおけるモデル性能とノイズ低減に与える影響は何か?
- RQ4生成物割合の調整を学習させることで、実験的ノイズに対してどの程度モデルのロバストネスが向上するか?
主な発見
- 全生成物と部分生成物を組み合わせ、学習された収率調整を含む完全なモデルが、テストデータで最高のR²スコアを達成し、三成分体のみを用いるか、一定収率を仮定するモデルを上回った。
- 学習された収率調整を含むモデルは、テストデータで優れた性能を示し、複数ラウンドの精製プロセスに起因するノイズの処理能力が向上していることが示された。
- 外部データセット(ベンダー化合物150種)において、学習済み収率を含む完全なモデルが最高の受信器操作特性曲線下積分(AUC)を達成し、優れた一般化性能を示した。
- 上位10件の予測バインダーにおけるヒットレートは、実験的に測定された収率と学習された調整を用いたモデルが最も高く、バーチャルスクリーニングにおける有効性が確認された。
- 二成分体生成物のみを用いたモデルが、三成分体生成物のみを用いたモデルよりも優れた性能を示し、部分生成物が無視できるノイズではなく、意味のある結合シグナルを含んでいる可能性を示唆した。
- 一定収率を仮定したモデルは、測定済み収率または学習済み収率を用いたモデルと比較してわずかな性能低下を示し、正確な割合モデル化の重要性が浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。