[논문 리뷰] DeepAtom: A Framework for Protein-Ligand Binding Affinity Prediction
DeepAtom은 3차원 격자화된 구조에서 원자 상호작용 패턴을 학습함으로써 최소한의 특징 공학으로 단백질-리간드 결합 친화도를 예측하는 데이터 기반 3D-CNN 프레임워크이다. 새로운 캘리브레이션된 벤치마크 데이터셋을 사용하여 PDBbind v.2016 코어 세트에서 Pearson R = 0.83 및 RMSE = 1.23 pK 단위로 SOTA 성능을 달성하였다.
The cornerstone of computational drug design is the calculation of binding affinity between two biological counterparts, especially a chemical compound, i.e., a ligand, and a protein. Predicting the strength of protein-ligand binding with reasonable accuracy is critical for drug discovery. In this paper, we propose a data-driven framework named DeepAtom to accurately predict the protein-ligand binding affinity. With 3D Convolutional Neural Network (3D-CNN) architecture, DeepAtom could automatically extract binding related atomic interaction patterns from the voxelized complex structure. Compared with the other CNN based approaches, our light-weight model design effectively improves the model representational capacity, even with the limited available training data. With validation experiments on the PDBbind v.2016 benchmark and the independent Astex Diverse Set, we demonstrate that the less feature engineering dependent DeepAtom approach consistently outperforms the other state-of-the-art scoring methods. We also compile and propose a new benchmark dataset to further improve the model performances. With the new dataset as training input, DeepAtom achieves Pearson's R=0.83 and RMSE=1.23 pK units on the PDBbind v.2016 core set. The promising results demonstrate that DeepAtom models can be potentially adopted in computational drug development protocols such as molecular docking and virtual screening.
연구 동기 및 목표
- 최소한의 특징 공학으로 끝에서 끝까지 데이터 기반의 단백질-리간드 결합 친화도 예측 프레임워크를 개발한다.
- 기존의 결합 친화도 데이터셋에서 발생하는 레이블 노이즈 문제를 해결하기 위해 체계적으로 분석하고 새로운 신뢰할 수 있는 벤치마크 데이터셋을 캘리브레이션한다.
- 세밀한 원자 상호작용을 포착하는 효율적인 3D-CNN 아키텍처를 사용하여 모델 성능과 일반화 능력을 향상시킨다.
- 독립된 테스트 세트에서 딥러닝, 머신러닝 및 전통적인 방법을 포함한 최신 스코링 함수들을 초월한다.
- 가상 스크리닝 및 분자 도킹과 같은 계산 기반 약물 개발 워크플로우에 실질적인 적용을 가능하게 한다.
제안 방법
- 1.0 Å 해상도와 PCMax 점유도 인코딩을 사용하여 단백질-리간드 복합체 구조를 3차원 격자로 변환하여 원자 기여도를 연속적으로 표현한다.
- 경량 3D-CNN 아키텍처를 사용하여 격자화된 3차원 격자 입력에서 자동으로 결합 관련 원자 상호작용 패턴을 추출한다.
- 단백질 및 리간드 원자를 24종의 원자 유형(ANOLEA 및 Arpeggio 유형 포함)과 원소 유형으로 표현하는 다중 채널 표현 방식을 적용한다.
- 테스트 시 데이터 증강을 통해 테스트 복합체의 여러 회전 또는 변형된 버전의 예측 평균값을 사용하여 분산을 줄인다.
- 레이블 노이즈를 최소화하고 일반화 능력을 향상시키기 위해 새로 편집된 고품질의 벤치마크 데이터셋을 기반으로 모델을 엔드 투 엔드로 훈련한다.
- PDBbind v.2016 및 Astex Diverse Set에서의 분석 실험을 통해 격자 해상도, 점유도 유형 및 특징 채널과 같은 하이퍼파rameter를 최적화한다.
실험 결과
연구 질문
- RQ13D-CNN 기반 프레임워크는 광범위한 특징 공학에 의존하지 않고도 단백질-리간드 결합 친화도 예측에서 SOTA 성능을 달성할 수 있는가?
- RQ2격자 해상도와 점유도 인코딩 전략의 선택이 모델 성능 및 계산 효율성에 어떤 영향을 미치는가?
- RQ3캘리브레이션된 고품질의 벤치마크 데이터셋을 사용할 경우 모델의 일반화 능력과 예측 정확도는 어느 정도 향상되는가?
- RQ4테스트 시 데이터 증강이 예측 분산을 효과적으로 줄이고 예측의 강건성을 향상시키는가?
- RQ5독립된 검증 세트에서 DeepAtom은 딥러닝 및 기존의 전통적 방법을 포함한 기존의 최신 스코링 함수들과 비교해 어떻게 성능을 냈는가?
주요 결과
- DeepAtom은 새로 제안된 벤치마크 데이터셋을 기반으로 훈련했을 때 PDBbind v.2016 코어 세트에서 Pearson 상관계수 R = 0.83 및 RMSE = 1.23 pK 단위를 달성한다.
- 모델은 PDBbind v.2016 벤치마크와 독립된 Astex Diverse Set 양쪽 모두에서 기존의 최신 스코링 함수, 딥러닝, 머신러닝 및 전통적 방법을 모두 초월한다.
- 이진 점유도 대신 PCMax 점유도 인코딩을 사용할 경우 성능 향상이 이루어지며, RMSE는 1.360에서 1.348로 감소하고 R은 0.737에서 0.741로 상승한다.
- 더 높은 격자 해상도(0.5 Å)는 성능을 약간 향상시키지만 계산 비용을 크게 증가시켜 최적의 해상도로 1.0 Å가 선택되었다.
- 테스트 복합체의 24개의 변형된 버전을 사용한 테스트 시 데이터 증강은 예측 분산을 줄이고 성능을 추가로 향상시킨다.
- 신규로 편집된 벤치마크 데이터셋은 Kd, Ka, Ki와 같은 신뢰할 수 있는 실험 측정치를 기반으로 필터링되어 레이블 노이즈를 감소시킴으로써 모델의 학습 및 일반화 능력을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.