[논문 리뷰] DiffPack: A Torsional Diffusion Model for Autoregressive Protein Side-Chain Packing
DiffPack은 네 가지 사이드체인 토션각의 결합 분포를 모델링하여 단백질 사이드체인 입체배치를 예측하는 자기회귀적 토션 확산 모델을 도입하고, 매개변수를 훨씬 적게 사용하면서 최첨단 각도 정확도를 달성하고 AlphaFold2의 사이드체인 예측을 개선합니다.
Proteins play a critical role in carrying out biological functions, and their 3D structures are essential in determining their functions. Accurately predicting the conformation of protein side-chains given their backbones is important for applications in protein structure prediction, design and protein-protein interactions. Traditional methods are computationally intensive and have limited accuracy, while existing machine learning methods treat the problem as a regression task and overlook the restrictions imposed by the constant covalent bond lengths and angles. In this work, we present DiffPack, a torsional diffusion model that learns the joint distribution of side-chain torsional angles, the only degrees of freedom in side-chain packing, by diffusing and denoising on the torsional space. To avoid issues arising from simultaneous perturbation of all four torsional angles, we propose autoregressively generating the four torsional angles from $χ_1$ to $χ_4$ and training diffusion models for each torsional angle. We evaluate the method on several benchmarks for protein side-chain packing and show that our method achieves improvements of $11.9\%$ and $13.5\%$ in angle accuracy on CASP13 and CASP14, respectively, with a significantly smaller model size ($60 imes$ fewer parameters). Additionally, we show the effectiveness of our method in enhancing side-chain predictions in the AlphaFold2 model. Code is available at https://github.com/DeepGraphLearning/DiffPack.
연구 동기 및 목표
- 고정된 백본(backbone) 구조가 주어졌을 때 사이드체인 구성을 예측하는 문제에 동기를 부여하고 해결합니다.
- 사이드체인 포장에서 자유도는 직교 좌표가 아닌 토션 각으로 정확히 모델링합니다.
- SE(3)-불변 지도를 갖는 지침과 함께 사이드체인 토션 χ1–χ4를 생성하기 위한 자기회귀 확산 프레임워크를 제안합니다.
- 정확도와 효율성을 입증하기 위해 CASP13/CASP14 벤치마크와 비자연적(backbones) 백본에서 평가합니다.
제안 방법
- 사이드체인 구성을 토션 공간에서 모델링하여 변수 수를 네 개의 토션 각 χ1–χ4로 축소합니다(잔여물별 개수에 따라 다름).
- 토션 공간에서의 순방향 분산 폭발 SDE를 적용하고 토션 도메인에서 노이즈 제거를 위한 점수 함수를 학습합니다.
- 각 χi에 대해 독립적인 확산 모델을 두고 p(χ1,χ2,χ3,χ4)=p(χ1)·p(χ2|χ1)·p(χ3|χ1,χ2)·p(χ4|χ1,χ2,χ3)라는 자기회귀 인자화를 사용합니다.
- 백본과 부분적으로 생성된 사이드체인으로부터 토션 각을 예측하기 위해 GearNet-Edge를 기반으로 한 SE(3)-불변 점수 네트를 사용합니다.
- 훈련 중에 타깃 토션 각에 대한 교사 강제(teacher-forcing)를 채택하여 교란을 타깃 토션 각으로 고립시키고 누적 왜곡을 피합니다.
- 다중 라운드 디노이징, 냉각된 온도 샘플링(어닐링), 신뢰도 모델을 통해 고품질 구성을 선택하는 등 샘플링을 향상시킵니다.
- 동일한 토션 상태를 고려하기 위해 확산 커널을 조정하여 π-회전 대칭성을 처리합니다.

실험 결과
연구 질문
- RQ1토션 공간에서 사이드체인 포장을 모델링하는 것이 카르테시안 좌표 방식보다 공유결합 결합 제약을 더 잘 반영할 수 있을까요?
- RQ2χ1–χ4를 자기회귀적으로 확산시키는 것이 네 각에 대한 공동 확산보다 생성 안정성과 정확도를 향상시키나요?
- RQ3최첨단 방법과 비교했을 때 CASP13/14 및 비자연적 백본(예: AlphaFold2)에서 DiffPack의 성능은 어떠한가요?
- RQ4정확도를 유지하거나 개선하면서 DiffPack 모델 크기가 상당히 작아지나요?
- RQ5샘플링 향상(다중 라운드, 어닐링, 신뢰도 모델)이 추론 품질을 향상시키나요?
주요 결과
- DiffPack은 CASP13에서 11.9%, CASP14에서 13.5%의 각도 정확도 향상을 달성합니다.
- 모델은 이전 최첨단 AttnPacker에 비해 약 60배 적은 매개변수를 사용합니다.
- DiffPack은 CASP13 및 CASP14에서 χ1–χ4에 대해 모든 잔류물 범주에서 최상의 Angle MAE 및 Angle Accuracy를 달성합니다.
- AlphaFold2 비자연적 백본에서 DiffPack은 대부분의 지표에서 AlphaFold2 및 다른 베이스라인을 지속적으로 능가합니다.
- 자기회귀 확산(χ1→χ4)은 훈련 안정성과 최종 품질에서 공동 확산 및 무작위 확산 베이스라인보다 우수합니다.
- 이 방법은 화학적 타당성(결합 길이/각도)을 보존하고 추가 사전 지식 없이도 π–π 스태킹과 같은 상호작용을 드러낼 수 있습니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.