[논문 리뷰] Preference optimization of protein language models as a multi-objective binder design paradigm
이 논문은 자동회귀 단백질 언어 모델(pLMs)에 직접 선호도 최적화(DPO)를 적용하여 다중 목적의 접힘 설계 프레임워크를 제안한다. 이는 결합 친화도와 유리한 물리화학적 성질을 갖춘 펩타이드 결합체를 생성한다. 선호되는 및 선호되지 않는 서열에 대한 정제된 선호도 데이터셋을 기반으로 ProtGPT2를 미세조정함으로써 이소일렉트릭 점수(pI)의 중앙값이 17%~60% 향상되었으며, 이는 시퀀스의 난이도를 유지하면서도 전문가가 주석 처리한 설계 기준에 효과적으로 일치함을 보여준다.
We present a multi-objective binder design paradigm based on instruction fine-tuning and direct preference optimization (DPO) of autoregressive protein language models (pLMs). Multiple design objectives are encoded in the language model through direct optimization on expert curated preference sequence datasets comprising preferred and dispreferred distributions. We show the proposed alignment strategy enables ProtGPT2 to effectively design binders conditioned on specified receptors and a drug developability criterion. Generated binder samples demonstrate median isoelectric point (pI) improvements by $17\%-60\%$.
연구 동기 및 목표
- 언어 모델을 사용하여 결합 친화도 외의 다수의 약물 개발 목표를 통합하는 계산 기반 프레임워크를 개발하는 것.
- 기존 방법들이 후행적으로 결합 친화도를 최적화하는 데 치중하는 데 반해, 생성 과정 중에 물리화학적 및 개발 가능성 제약 조건을 동시에 통합하는 데 있어 격차를 메우는 것.
- 전문가가 정제한 선호도 데이터(선호되는 대비 선호되지 않는 서열)를 DPO를 통해 pLMs에 직접 통합함으로써, 후행 단계의 회귀 모델이나 분류기 의존도를 줄이는 것.
- 합성 가능성 및 발현 실패와 같은 비수치적 기준을 선호 신호에 통합함으로써, 임상적으로 유의미한 리드 분자의 생성 가능성을 높이는 것.
- DPO가 pI를 향상시키면서도 시퀀스 품질과 결합 가능성은 유지하는 방식으로 pLMs를 효과적으로 일치시킬 수 있음을 보여주는 것.
제안 방법
- 이 방법은 이중 단계 트레이닝 파이프라인을 사용한다: 첫 번째 단계는 OpenAI chatML 형식을 사용하여 수용체-결합체 지시 템플릿에 기반해 ProtGPT2를 지도 미세조정(SFT)하여 조건부 생성을 가능하게 한다.
- 두 번째 단계는 SFT 모델을 선호도 데이터 쌍을 사용하여 DPO를 적용하여 미세조정하는 것으로, 선호되는 결합체(높은 pI) 대비 선호되지 않는 결합체(낮은 pI)를 포함한, 먼 단백질의 가짜 서열 또는 진짜 결합체의 변형을 포함한다.
- 선호도 데이터셋은 각 진짜 결합체와 여러 개의 선호되지 않는 가짜 서열을 쌍으로 묶어 구성되며, 총 66,898개의 트리플릿(단백질, 결합체, 가짜 서열)을 학습용으로 사용하고, 3,345개는 테스트용으로 분리한다.
- DPO 목적함수는 SFT 모델에서의 KL 발산을 제약하면서 선호되는 서열과 선호되지 않는 서열 간의 보상 간격을 최대화하여, 시퀀스 품질을 떨어뜨리지 않으면서도 모델의 일치도를 향상시킨다.
- 시퀀스 생성은 빔 서치, top-k, 그리고 그레디 샘플링을 사용하여 난이도, pI, 진짜 결합체에 대한 일치도 점수를 평가한다.
- 모델 성능 평가는 DPO 손실, 보상 간격, 정확도, 난이도, pI 향상도, 진짜 결합체에 대한 일치도 점수 등 다양한 지표를 통해 다중 목적 최적화 성공 여부를 평가한다.
실험 결과
연구 질문
- RQ1직접 선호도 최적화(DPO)가 다중 설계 목표(결합 친화도 및 물리화학적 성질 포함)를 만족하는 펩타이드 결합체를 생성하는 데 효과적으로 적용될 수 있는가?
- RQ2DPO는 시퀀스 난이도를 낮추고 진짜 결합체와의 유사도를 유지하면서도, 생성된 결합체의 이소일렉트릭 점수(pI)를 어느 정도 향상시킬 수 있는가?
- RQ3합성 가능성이나 발현 실패와 같은 비수치적 제약 조건을 포함한 전문가가 정제한 선호도 데이터의 통합이 생성된 결합체의 품질과 다양성에 어떤 영향을 미치는가?
- RQ4DPO는 선호되는 서열 분포와 바람직한 물리화학적 성질을 동시에 만족하는 결합체를 생성하는 데 표준 SFT보다 우수한가?
- RQ5이 프레임워크는 펩타이드를 초월해 다른 단백질 또는 소분자 설계 과제에도 일반화될 수 있는가?
주요 결과
- DPO 최적화 모델은 테스트 정확도 97%와 보상 간격 15.3을 기록하여 선호되는 서열과 선호되지 않는 서열 간의 강력한 선호도 구분 능력을 입증했다.
- 모든 샘플링 전략(빔 서치, top-k, 그레디)에서 이소일렉트릭 점수(pI)가 중앙값 기준으로 17%~60% 향상되었으며, 50%의 결합체에서 pI가 2배로 향상되었다.
- 모든 샘플링 방법에서 난이도가 낮게 유지되었으며, 50%의 생성된 결합체가 난이도 1.5 이하, 90%가 40 이하였고, 이는 DPO 이후 시퀀스 품질에 심각한 악화가 없음을 의미한다.
- DPO 이후 동일한 단백질 클러스터 내 진짜 결합체에 대한 일치도 점수가 유의미하게 향상되어 생물학적으로 관련된 서열과의 유사도가 향상됨을 확인했다.
- 이 프레임워크는 비수치적 전문가 기준(예: 발현 실패, 합성 불가능성)을 선호 신호에 통합하여, 단일 성질 최적화를 넘어서는 설계 제약 조건의 범위를 확장했다.
- 이 방법은 pLMs에 다중 목적 설계 기준을 간편하고 종단 간 통합할 수 있도록 하여, 후행 필터링에 대한 의존도를 줄이고 개발 가능한 리드 화합물 생성 가능성을 높였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.