[論文レビュー] FusionDTI: Fine-grained Binding Discovery with Token-level Fusion for Drug-Target Interaction
FusionDTI は、事前学習済み言語モデル(Saprot および SELFormer)を SELFIES および構造に配慮したタンパク質トークン化と組み合わせることで、原子レベルおよびアミノ酸残基レベルでの微細な薬物-標的相互作用を捉えるトークンレベルの統合モデルを提案する。BindinDB において、最良のベースライン比で6%の精度向上を達成するとともに、結合部位の注意マップ可視化により説明可能性を向上させた。
Predicting drug-target interaction (DTI) is critical in the drug discovery process. Despite remarkable advances in recent DTI models through the integration of representations from diverse drug and target encoders, such models often struggle to capture the fine-grained interactions between drugs and protein, i.e. the binding of specific drug atoms (or substructures) and key amino acids of proteins, which is crucial for understanding the binding mechanisms and optimising drug design. To address this issue, this paper introduces a novel model, called FusionDTI, which uses a token-level Fusion module to effectively learn fine-grained information for Drug-Target Interaction. In particular, our FusionDTI model uses the SELFIES representation of drugs to mitigate sequence fragment invalidation and incorporates the structure-aware (SA) vocabulary of target proteins to address the limitation of amino acid sequences in structural information, additionally leveraging pre-trained language models extensively trained on large-scale biomedical datasets as encoders to capture the complex information of drugs and targets. Experiments on three well-known benchmark datasets show that our proposed FusionDTI model achieves the best performance in DTI prediction compared with seven existing state-of-the-art baselines. Furthermore, our case study indicates that FusionDTI could highlight the potential binding sites, enhancing the explainability of the DTI prediction.
研究の動機と目的
- 既存の DTI モデルが特定の薬物原子と標的アミノ酸間の微細な相互作用を捉えることの限界を解消すること。
- トークンレベルでの結合部位の同定と可視化を通じて、DTI 予測の説明可能性を向上させること。
- SELFIES および構造に配慮した(SA)語彙を用いて構造情報を統合することで、薬物およびタンパク質の表現学習を向上させること。
- 薬物および標的トークン間のクロスモーダル相互作用を効果的に捉える統合メカニズムを構築することにより、予測性能を向上させること。
提案手法
- 化学的妥当性を保証するとともに構造情報を符号化するため、薬物に SELFIES 表現を用いる。
- 3次元構造的文脈を組み込んだ構造に配慮した(SA)語彙を備えた事前学習済み言語モデルである Saprot を用い、タンパク質配列を3次元構造的文脈とともに符号化する。
- 分子配列のための事前学習済み言語モデルである SELFormer を用い、薬物分子の文脈的埋め込みを生成する。
- クロスアテンションネットワーク(CAN)および双線形アテンションネットワーク(BAN)を用いたトークンレベル統合(TF)モジュールを実装し、薬物および標的トークン間の微細な相互作用を学習する。
- 個々の薬物原子およびアミノ酸残基が最終的な DTI 予測に寄与する寄与度を、クロスアテンションマップを用いて可視化する。
- 凍結されたエンコーダーと分類器ヘッドを用い、3つのベンチマークデータセットでモデルを訓練し、バイナリ相互作用予測を実行する。

実験結果
リサーチクエスチョン
- RQ1薬物および標的表現間のトークンレベル統合は、既存の最先端モデルと比較して、DTI 予測の精度を向上させることができるか?
- RQ2SELFIES および構造に配慮したタンパク質トークン化の使用は、化学的に意味のあるおよび構造的にインフォームドな相互作用を捉える能力をモデルが向上させるか?
- RQ3統合モジュールは、原子および残基レベルでの特定の結合部位を強調できるか、これによりモデルの説明可能性が向上するか?
- RQ4CAN と BAN のどちらの統合メカニズムが、DTI における微細な相互作用を捉える上で、より優れたパフォーマンスと効率性を示すか?
主な発見
- FusionDTI は、3つのベンチマークデータセットにおいて7つの最先端ベースラインと比較して最高のパフォーマンスを達成し、BindinDB データセットでは最良のベースライン比で6%の精度向上を達成した。
- クロスアテンションネットワーク(CAN)モジュールは、すべての統合スケール設定において BAN を上回り、微細な相互作用を捉える上で優れた効果性と効率性を示した。
- ケーススタディにおいて、モデルは潜在的な結合部位を効果的に特定した。これは、DrugBAN が同定しなかった新規の予測、例えばスルホンアミド酸素およびアミノ基が特定の残基と相互作用する場合を含む。
- Saprot と SELFormer をエンコーダーとして組み合わせた場合が最高のパフォーマンスを示し、両者が豊かな意味的および構造的情報を捉える有効性を確認した。
- アテンション可視化により、モデルが生物学的に関連する残基および機能的官能基に注目していることが確認され、予測の解釈可能性が向上した。
- 構造に配慮した語彙の使用により、モデルはタンパク質表現に3次元構造的文脈を統合でき、標準的なアミノ酸配列を超えた相互作用モデリングが向上した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。