Skip to main content
QUICK REVIEW

[논문 리뷰] ADMET property prediction through combinations of molecular fingerprints

James H. Notwell, Michael W. Wood|arXiv (Cornell University)|2023. 09. 29.
Computational Drug Discovery Methods인용 수 7
한 줄 요약

이 논문은 확장된 연결성 필터프린트(Extended-Connectivity Fingerprints, ECFP), Avalon, ErG 및 200개의 분자 특성을 조합한 CatBoost 회귀 모델을 제안하여 ADMET 성질을 예측한다. 이 모델은 Therapeutics Data Commons의 22개 벤치마크 중 6개에서 상위 1위 성능을 기록하고 16개에서 상위 3위 성능을 기록하여, 풍부한 분자 표현 방식이 딥 러닝 모델보다 예측 정확도를 크게 향상시킨다는 것을 입증한다.

ABSTRACT

While investigating methods to predict small molecule potencies, we found random forests or support vector machines paired with extended-connectivity fingerprints (ECFP) consistently outperformed recently developed methods. A detailed investigation into regression algorithms and molecular fingerprints revealed gradient-boosted decision trees, particularly CatBoost, in conjunction with a combination of ECFP, Avalon, and ErG fingerprints, as well as 200 molecular properties, to be most effective. Incorporating a graph neural network fingerprint further enhanced performance. We successfully validated our model across 22 Therapeutics Data Commons ADMET benchmarks. Our findings underscore the significance of richer molecular representations for accurate property prediction.

연구 동기 및 목표

  • 딥 뉴럴 네트워크에 의존하지 않고도 소분자의 ADMET 성질을 예측하기 위한 강력하고 일반화 가능한 모델을 개발하는 것.
  • 기존 기계학습 모델에 분자 필터프린트를 조합할 경우 최신 딥 러닝 모델보다 ADMET 예측에서 뛰어난 성능을 내는지 조사하는 것.
  • 다양한 필터프린트 유형과 분자 서술자 조합이 예측 성능에 미치는 영향을 평가하는 것.
  • 표준화된 벤치마크를 사용하여 모델의 다양한 ADMET 작업에 대한 일반화 능력을 검증하는 것.
  • 통합된 특성 표현 프레임워크 내에서 그래프 신경망 필터프린트가 성능 향상에 기여하는지 탐색하는 것.

제안 방법

  • 모델는 ECFP, Avalon, ErG 필터프린트 및 200개의 분자 특성을 포함한 통합된 분자 표현 방식을 사용하는 CatBoost 회귀 모델이다.
  • 특성 공학은 ECFP, Avalon, ErG 등의 다수 필터프린트 유형과 분자량, 고리 수 등 수치적 분자 서술자를 연결하여 수행된다.
  • 일반화 능력을 확보하기 위해 시간 기반 분할 검증 전략을 적용하였으며, 특정 일자 이후에 프로파일링된 분자들을 최종 테스트 세트로 확보하였다.
  • 하이퍼파rameter 최적화는 Optuna를 사용하였고, 통합의 용이성 때문에 실용적인 튜닝에는 LightGBM을 활용하였다.
  • 신경망 기반 필터프린트 향상을 탐색하기 위해 특성 세트에 감독 마스킹를 적용한 그래프 이소모르피즘 네트워크(GIN)를 추가하였다.
  • 모델 성능은 Therapeutics Data Commons의 22개 ADMET 벤치마크를 사용하여 평균 절대 오차와 순위 기반 비교를 통해 평가되었다.
Figure 1: Relative performance of the MapLight model, with (orange) and without (yellow) GNN fingerprints, compared to the current TDC leaderboards (dark blue). Bar heights and error bars correspond to the mean and standard deviation across 5 random seeds.
Figure 1: Relative performance of the MapLight model, with (orange) and without (yellow) GNN fingerprints, compared to the current TDC leaderboards (dark blue). Bar heights and error bars correspond to the mean and standard deviation across 5 random seeds.

실험 결과

연구 질문

  • RQ1기존 기계학습 모델에 다수의 분자 필터프린트를 조합할 경우, 딥 러닝 모델보다 ADMET 성질 예측에서 뛰어난 성능을 내는가?
  • RQ2ECFP, Avalon, ErG 등의 다수 필터프린트 유형을 통합할 경우 개별 필터프린트 유형 대비 예측 정확도에 어떤 영향을 미치는가?
  • RQ3필터프린트와 함께 분자 특성이 조합될 경우 모델 성능 향상에 어느 정도 기여하는가?
  • RQ4그래프 신경망 필터프린트를 추가하면 다양한 ADMET 작업 전반에서 성능 향상이 이루어지는가?
  • RQ5특정 작업에 맞춘 미세조정 없이도 단일 통합 모델이 22개의 다른 ADMET 예측 벤치마크에 일반화 가능한가?

주요 결과

  • ECFP, Avalon, ErG 필터프린트 및 200개의 분자 특성을 조합한 CatBoost 모델은 Therapeutics Data Commons의 22개 ADMET 벤치마크 중 6개에서 상위 1위 성능을 기록하였다.
  • 동일한 모델은 22개의 벤치마크 중 16개에서 상위 3위 성능을 기록하여 다양한 ADMET 작업에 걸쳐 강력한 일반화 능력을 입증하였다.
  • GIN(Graph Isomorphism Network) 필터프린트를 추가함으로써 성능 향상이 이루어졌으며, 이로 인해 22개의 벤치마크 중 11개에서 상위 1위 성능, 19개에서 상위 3위 성능을 기록하였다.
  • 심층적인 하이퍼파rameter 튜닝에도 불구하고, 기본 설정인 LightGBM 또는 CatBoost 설정을 초월한 유의미한 성능 향상은 발견되지 않았다. 유일한 예외는 CatBoost의 랜덤 강도(random strength) 조정이었다.
  • 시간 기반 분할 검증에서도 성능가 일관되었으며, 이는 시간에 따른 데이터 드리프트에 대해 견고하고 과적합 위험이 낮다는 것을 시사한다.
  • 사전 훈련된 대규모 데이터셋을 기반으로 한 딥 러닝 모델인 Chemprop, ChemBERTa, Grover와 비교하여도, 전통적인 필터프린트 기반 모델이 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.