Skip to main content
QUICK REVIEW

[논문 리뷰] Activity Cliff Prediction: Dataset and Benchmark

Ziqiao Zhang, Bangyi Zhao|arXiv (Cornell University)|2023. 02. 15.
Computational Drug Discovery Methods인용 수 6
한 줄 요약

이 논문은 약물 발굴에서 활성성 폭포(AC) 예측을 위한 첫 번째 대규모 벤치마크 데이터셋인 ACNet을 소개한다. 이 데이터셋은 190개 타겟에 걸쳐 40만 개가 넘는 일치하는 분자 쌍(MMPs)을 포함하며, 이 중 2만 개는 MMP-폭포로 레이블링되어 있다. 16개의 딥러닝 모델을 평가하는 기준 프레임워크를 제안했으며, 기존의 ECFP 지문이 대부분의 딥 네트워크보다 뛰어나며, 특히 데이터가 부족한 상황과 분포 외 일반화 상황에서 뛰어난 성능을 보여, 딥러닝 모델이 AC 예측에 직면한 과제를 드러낸다.

ABSTRACT

Activity cliffs (ACs), which are generally defined as pairs of structurally similar molecules that are active against the same bio-target but significantly different in the binding potency, are of great importance to drug discovery. Up to date, the AC prediction problem, i.e., to predict whether a pair of molecules exhibit the AC relationship, has not yet been fully explored. In this paper, we first introduce ACNet, a large-scale dataset for AC prediction. ACNet curates over 400K Matched Molecular Pairs (MMPs) against 190 targets, including over 20K MMP-cliffs and 380K non-AC MMPs, and provides five subsets for model development and evaluation. Then, we propose a baseline framework to benchmark the predictive performance of molecular representations encoded by deep neural networks for AC prediction, and 16 models are evaluated in experiments. Our experimental results show that deep learning models can achieve good performance when the models are trained on tasks with adequate amount of data, while the imbalanced, low-data and out-of-distribution features of the ACNet dataset still make it challenging for deep neural networks to cope with. In addition, the traditional ECFP method shows a natural advantage on MMP-cliff prediction, and outperforms other deep learning models on most of the data subsets. To the best of our knowledge, our work constructs the first large-scale dataset for AC prediction, which may stimulate the study of AC prediction models and prompt further breakthroughs in AI-aided drug discovery. The codes and dataset can be accessed by https://drugai.github.io/ACNet/.

연구 동기 및 목표

  • 약물 발굴에서 활성성 폭포(AC) 예측을 위한 표준화된 벤치마크 데이터셋의 부족 문제를 해결하기 위해.
  • 불균형, 저자료, 분포 외 일반화 하위세트를 포함한 다양하고 대규모인 데이터셋을 사용하여 딥러닝 모델의 AC 예측 성능을 평가하기 위해.
  • 딥 뉴럴 네트워크가 분자 성질 예측에서 성공을 거두었음에도 불구하고, 미세한 활성성 폭포 현상을 포착하는 데에 한계를 보이는 이유를 조사하기 위해.
  • 재현 가능한 벤치마크와 오픈소스 자원을 제공하여 향후 AI 기반 약물 개발 연구의 기반을 마련하기 위해.

제안 방법

  • ChEMBL에서 ACNet을 정제하여 190개 타겟에 걸쳐 40만 개가 넘는 일치하는 분자 쌍(MMPs)을 추출하였으며, 이 중 2만 개는 MMP-폭포로, 38만 개는 비-AC로 레이블링됨.
  • 다양한 과제를 강조하는 다섯 가지 별도의 데이터 하위세트—Large, Medium, Small, Few, Mix—를 설계함: 데이터 불균형, 저자료 제도, 분포 외 일반화.
  • 16개의 모델(예: GCN, GIN, Graphormer, ECFP 등)에서 유도된 분자 표현을 사용하는 통합 기준 프레임워크를 구현하여, 이는 이진 분류를 위한 하류 MLP에 입력됨.
  • 모든 하위세트에서 표준 평가 지표(AUC, 정확도)를 적용하였으며, 분포 외 일반화를 위해 타겟 분할 평가도 실시함.
  • Few 하위세트에서 소수 샘플 학습을 위해 사전학습-미세조정 파라디그마를 적용하였으며, 사전학습된 분자 표현 모델은 고정하고 분류기 헤드만 미세조정함.
  • 딥 그래프 신경망과 기존의 지문 기반 방법(예: ECFP)의 성능을 비교하여, 학습된 표현과 수작업 표현의 효용성을 평가함.

실험 결과

연구 질문

  • RQ1구조적 변화가 미미한 분자 쌍에서 활성도의 큰 차이가 있는 활성성 폭포 관계를 딥러닝 모델이 효과적으로 예측할 수 있는가?
  • RQ2다양한 데이터 가용성 수준에서, 다양한 분자 표현 학습 방법(예: GNNs, ECFP)의 성능가지 AC 예측에서 어떻게 비교되는가?
  • RQ3학습 중에 볼 수 없었던 타겟(분포 외 타겟)에 대해 딥러닝 모델의 일반화 능력은 어느 정도이며, 특히 타겟 분할 평가에서 어떻게 나타나는가?
  • RQ4왜 ECFP는 저자료 및 분포 외 조건에서 최신 딥러닝 모델보다 성능이 뛰어나며, 그 이유는 무엇인가?
  • RQ5딥 뉴럴 네트워크의 성공에도 불구하고 분자 성질 예측 과제에서 성능을 저해하는 활성성 폭포 예측의 핵심 과제는 무엇인가?

주요 결과

  • ECFP에 단순한 MLP를 사용한 경우 Large 하위세트에서 최고의 AUC 0.984를 기록하여, Graphormer와 GIN을 포함한 모든 딥러닝 모델을 능가함.
  • Few 하위세트에서 ECFP는 8개의 사전학습된 모델 중에서 AUC 0.813로 두 번째로 높은 성능을 기록하였으며, 대부분의 GNN 기반 모델보다 우수하여 저자료 제도에서의 ECFP의 강건성을 보여줌.
  • 타겟 분할 평가에서 Mix 하위세트에서 성능 저하가 심각하게 나타났으며, ECFP+MLP는 무작위 분할 시 AUC 0.960에서 타겟 분할 시 AUC 0.522로 급격히 떨어져 분포 외 일반화 능력이 떨어짐.
  • GCN는 Mix 하위세트에서 분포 외 성능이 가장 우수하여 AUC 0.579를 기록했지만, 이마저도 타겟 간 일반화 가능한 패턴을 포착하지 못한 것으로 나타나 상당한 실패를 보임.
  • GIN과 Graphormer 모델은 소규모 및 소수 샘플 하위세트에서 성능이 열악하여 AUC가 0.63 이하에 머물러, 희소 데이터에서의 학습 능력에 한계가 있음을 시사함.
  • 결과적으로, 데이터 불균형, 저자료 제도, 분포 이탈 등 다양한 과제가 존재함에도 불구하고, 고도화된 분자 표현 학습 기법을 사용하더라도 AC 예측은 여전히 딥러닝 모델에게 큰 과제로 남아 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.