[논문 리뷰] Meaningful machine learning models and machine-learned pharmacophores from fragment screening campaigns
이 연구는 프래그먼트 스크리닝 데이터를 기반으로 훈련된 해석 가능한 기계학습 모델을 소개하며, 실험적으로 검증된 '진짜 실수'를 포함시켜 예측 정확도를 향상시키고, 화학적으로 의미 있는 상호작용 패턴을 식별하기 위한 기여도 프레임워크를 사용한다. 주요 기여는 모델 예측을 특정 약리학적 기능에 맵핑하는 검증된 물리적 해석 가능한 방법으로, 모델 성능이 열등할 때조차도 전문가가 애너테이션한 분자의 상호작용과 강한 일치를 보인다.
Machine learning (ML) is widely used in drug discovery to train models that predict protein-ligand binding. These models are of great value to medicinal chemists, in particular if they provide case-specific insight into the physical interactions that drive the binding process. In this study we derive ML models from over 50 fragment-screening campaigns to introduce two important elements that we believe are absent in most -- if not all -- ML studies of this type reported to date: First, alongside the observed hits we use to train our models, we incorporate true misses and show that these experimentally validated negative data are of significant importance to the quality of the derived models. Second, we provide a physically interpretable and verifiable representation of what the ML model considers important for successful binding. This representation is derived from a straightforward attribution procedure that explains the prediction in terms of the (inter-)action of chemical environments. Critically, we validate the attribution outcome on a large scale against prior annotations made independently by expert molecular modellers. We find good agreement between the key molecular substructures proposed by the ML model and those assigned manually, even when the model's performance in discriminating hits from misses is far from perfect. By projecting the attribution onto predefined interaction prototypes (pharmacophores), we show that ML allows us to formulate simple rules for what drives fragment binding against a target automatically from screening data.
연구 동기 및 목표
- 단백질-리간드 결합에 대한 기계학습 모델에서 신뢰할 수 있는 음성 데이터의 부족을 해결하기 위해 프래그먼트 스크리닝 캠패aign에서 실험적으로 검증된 '진짜 실수'를 포함시키는 것.
- 블랙박스 모델을 넘어서 물리적으로 해석 가능하고 검증 가능한 결합 예측 설명을 제공하는 기계학습 프레임워크를 개발하는 것.
- 경험적인 전문가 애너테이션을 기반으로 한 독립적인 전문가의 분자 모델러가 제공한 애너테이션과 비교하여 모델의 해석 가능성에 대한 검증을 수행하는 것.
- 스크리닝 데이터에서 직접 기계학습을 통해 단순한 규칙 기반 프래그먼트 모델을 유도함으로써 히트-투-리드 최적화를 위한 자동화된 통찰 생성을 가능하게 하는 것.
- 기여도 필드가 공유 결합 모티프에 대한 사전 지식 없이도 결합 관련 화학적 환경을 정확히 국소화할 수 있음을 보여주는 것.
제안 방법
- 연구는 원자 환경 유사성에 기반한 커널 기반 기계학습 접근법을 사용하며, 이는 $G_{nl}Y_{lm}$ 기술자에 의해 표현된다. 이는 프로브 프래그먼트와 훈련 세트 분자 간의 쌍별 커널 값을 계산하는 데 사용된다.
- 기여도 가중치는 통합 기울기의 수정된 버전을 사용하여 계산되며, 정의는 $ z_a = \frac{1}{\text{norm}} \times \text{integral over } \alpha \text{ of } \partial Z_A / \partial k_{ab} $ 로, $ k_{ab} $ 는 원자 a와 b 간의 유사도를 측정한다.
- 국소화된 기여도 필드 $ \varphi(\hat{z}) $ 는 원자 중심 주변의 기여도 가중치를 거리 가중 평균으로 정의하며, 매개변수 $ \alpha $ 를 가진 가우시안 커널을 사용하여 중요한 상호작용의 공간 국소화를 가능하게 한다.
- 기본 입력값 $ x' $ 와 z-점수 기반 기여도 가중치 $ \hat{z} $ 를 사용하여 다양한 분자 환경 간의 필드 표현을 정규화하고 안정화한다.
- 프레임워크는 기여도 결과를 사전 정의된 프래그먼트 프로토타입에 투영함으로써 추상적인 모델 출력을 해석 가능하고 규칙 기반의 통찰으로 변환한다.
- 모델의 해석 가능성은 18개의 결합 부위에서 경험이 풍부한 분자 모델러가 수작업으로 정리한 프래그먼트 애너테이션과 비교하여 철저히 검증된다.
실험 결과
연구 질문
- RQ1실험적으로 검증된 '진짜 실수'를 훈련 데이터에 포함시키는 것이 프래그먼트 스크리닝 데이터를 기반으로 훈련된 기계학습 모델의 성능과 신뢰성에 상당한 영향을 미치는가?
- RQ2기계학습 모델이 단백질-리간드 결합 예측에 대해 물리적으로 해석 가능하고 검증 가능한 설명을 얼마나 잘 생성할 수 있는가?
- RQ3기계학습 기반 기여도 필드가 전문가가 애너테이션한 프래그먼트에 대해 핵심 결합 서브스트럭처를 얼마나 잘 식별하는가?
- RQ4기존의 구조적 지식 없이도 모델의 기여도 메커니즘이 결합 관련 화학적 환경을 신뢰성 있게 국소화할 수 있는가?
- RQ5모델의 출력이 스크리닝 데이터에서 직접 단순한 규칙 기반 프래그먼트 모델로 변환될 수 있는 정도는 어느 정도인가?
주요 결과
- 관측된 히트만을 기반으로 훈련된 모델에 비해, 실험적으로 검증된 '진짜 실수'를 훈련 데이터에 포함시킴으로써 얻어진 기계학습 모델의 품질과 강건성이 상당히 향상된다.
- 기계학습 기반 기여도 필드는 결합 관련 기능의 강력한 공간 국소화를 보이며, 코valent 억제제의 경우 사전 정보 없이도 아세틸기 그룹이 핵심 결합 모티프임을 정확히 식별한다.
- 비공유 결합 프래그먼트 히트의 경우, 기여도 필드는 단일 주요 결합 모티프가 없는 것과 일치하는 흐릿한 패턴을 보이며, 이러한 경우에서 모델의 예측 정확도가 낮은 이유를 설명한다.
- 모델의 기여도가 식별한 핵심 분자 서브스트럭처와 전문가 분자 모델러가 수작업으로 할당한 것 사이에 강한 일치가 존재하며, 이는 모델의 분류 성능가 낮을 때조차도 성립한다.
- 기여도 필드가 사전 정의된 프래그먼트 프로토타입에 투영될 경우, 프래그먼트 결합에 대한 단순하고 해석 가능한 규칙를 도출할 수 있으며, 이는 스크리닝 데이터에서 자동으로 프래그먼트 가설을 생성하는 데 기여한다.
- 기여도 필드의 표준편차를 계산하기 위해 부트스트랩 리샘플링을 사용함으로써 불확실성의 신뢰할 수 있는 측정이 가능해져 모델의 해석 가능성에 대한 신뢰도가 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.