[논문 리뷰] APObind: A Dataset of Ligand Unbound Protein Conformations for Machine Learning Applications in De Novo Drug Design
APObind는 PDBbind의 리간드 결합형(하로) 단백질 구조와 짝을 이룬 리간드 미결합형(아포) 단백질 구조로 구성된 대규모 데이터셋으로, 신약 설계에서의 기계학습 모델 평가를 강력하게 가능하게 한다. 이 연구는 단지 하로 구조로만 훈련된 모델이 아포 구조에서 유의미하게 성능이 떨어지는 것으로 나타내어, 실제 신약 개발 환경에서 일반화 능력 향상을 위해 아포 데이터를 포함할 필요성이 매우 크다는 점을 강조한다.
Protein-ligand complex structures have been utilised to design benchmark machine learning methods that perform important tasks related to drug design such as receptor binding site detection, small molecule docking and binding affinity prediction. However, these methods are usually trained on only ligand bound (or holo) conformations of the protein and therefore are not guaranteed to perform well when the protein structure is in its native unbound conformation (or apo), which is usually the conformation available for a newly identified receptor. A primary reason for this is that the local structure of the binding site usually changes upon ligand binding. To facilitate solutions for this problem, we propose a dataset called APObind that aims to provide apo conformations of proteins present in the PDBbind dataset, a popular dataset used in drug design. Furthermore, we explore the performance of methods specific to three use cases on this dataset, through which, the importance of validating them on the APObind dataset is demonstrated.
연구 동기 및 목표
- 리간드 결합형(하로) 단백질 구조로 훈련되는 기계학습 모델이 실제 천연 미결합형(아포) 구조에 적용될 때 발생하는 일반화 갭을 해결하기 위함.
- PDBbind의 하로 구조와 구조적으로 정렬된 대규모이고 정제된 아포 구조 데이터셋을 구축하여 결합 친화도 값을 유지하기 위함.
- 기존 기계학습 방법의 아포 구조에서의 성능을 평가하여 하로 구조로만 훈련된 경우의 한계를 입증하기 위함.
- 모델 훈련 시 아포 구조를 포함함으로써 아포 및 하로 구조 모두에서 일반화 능력과 성능 향상이 가능하다는 것을 입증하기 위함.
제안 방법
- PDBbind의 하로 구조와 80% 이상의 일치를 보이는 아포 단백질 구조를 식별하기 위해 BLAST를 사용함.
- Cα 원자 기반의 구조적 정렬을 수행하고, 백본 RMSD가 15 Å 초과이거나, 서열 일치율이 80% 미만이거나, 리간드와의 거리가 4 Å 미만인 경우를 제거함.
- 이성질체 원자를 제거하고, 정렬된 체인들만 유지하여 아포 등가 구조를 생성함.
- 작용성 분자 결합 부위에 집중하기 위해 분자량이 1000 Da 초과인 복합체를 제거함.
- 70% 서열 일치율 클러스터링을 사용하여 훈련(7638개) 및 테스트(2961개) 세트로 분할함.
- 세 가지 응용 사례 평가: 리간드 도킹(smina), 결합 친화도 예측(Pafnucy), 결합 부위 탐지(DeepPocket).
실험 결과
연구 질문
- RQ1기존 기계학습 기반 리간드 도킹 방법의 성능은 아포 단백질 구조에 적용했을 때 하로 구조에 비해 어떻게 떨어지는가?
- RQ2아포 구조로 훈련함으로써 결합 친화도 예측 모델의 성능은 아포 및 하로 구조 모두에서 얼마나 향상되는가?
- RQ3아포 구조로만 훈련된 모델은 하로 구조로의 일반화 능력이 더 뛰어나며, 하로 구조로만 훈련된 모델과 비교해 어떤가?
- RQ4아포 및 하로 구조 간의 구조적 이탈이 결합 부위 탐지 도구의 성능에 어떤 영향을 미치는가?
- RQ5훈련 데이터에 아포 구조를 포함시키는 것이 신약 설계에서의 기계학습 모델의 강건성과 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- smina를 사용한 리간드 도킹은 아포 구조에서 13.74%의 Top-1 성공률를 기록했으나, 하로 구조에서는 57.94%로, 성능 격차가 44.2%에 이르렀다.
- Top-5 도킹 성공률는 아포 구조에서 27.48%였고, 하로 구조에서는 76.49%로, 도킹 도구의 아포 구조로의 일반화 능력이 열 劣하다는 점을 시사한다.
- 아포 및 하로 데이터로 훈련된 Pafnucy 모델은 하로 테스트 세트에서 1.535 Å RMSD, 아포 테스트 세트에서 1.592 Å RMSD를 기록하여, 하로 데이터로만 훈련된 모델보다 아포 구조에서 0.075 Å 높은 성능을 보였다.
- 아포 데이터로만 훈련된 모델는 아포 테스트 세트에서 0.485의 피어슨 상관계수(R)를 기록했지만, 하로 세트에서는 0.452 R로 떨어져 이식성 능력이 열 劣하다는 점을 보여주었다.
- DeepPocket를 사용한 결합 부위 탐지에서는 아포 데이터로 훈련한 모델이 아포 구조에서 42.15%의 Top-1 정확도를 기록했지만, 하로 데이터로 훈련한 동일한 모델은 아포 구조에서 테스트했을 때 정확도가 33.54%로 떨어졌다.
- 아포 및 하로 데이터로 훈련된 모델은 아포 구조에서 61.39%의 Top-3 정확도, 하로 구조에서는 76.99%의 정확도를 기록하여, 아포 또는 하로 데이터로만 훈련된 모델보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.