[논문 리뷰] ProLLM: Protein Chain-of-Thoughts Enhanced LLM for Protein-Protein Interaction Prediction
이 논문은 생물학적 신호 전달 경로를 자연어 추론 체인으로 모델링함으로써 단백질-단백질 상호작용(PPI)을 예측하기 위해 단백질 사슬의 사고(ProCoT) 프롬프팅을 통합한 대규모 언어 모델 프레임워크인 ProLLM을 제안한다. ProCoT는 직접적인 물리적 결합을 넘어서 간접적이고 다단계적인 단백질 상호작용을 포착할 수 있게 하여 기존 방법에 비해 벤치마크 데이터셋에서 예측 정확도와 일반화 능력이 크게 향상된다.
The prediction of protein-protein interactions (PPIs) is crucial for understanding biological functions and diseases. Previous machine learning approaches to PPI prediction mainly focus on direct physical interactions, ignoring the broader context of nonphysical connections through intermediate proteins, thus limiting their effectiveness. The emergence of Large Language Models (LLMs) provides a new opportunity for addressing this complex biological challenge. By transforming structured data into natural language prompts, we can map the relationships between proteins into texts. This approach allows LLMs to identify indirect connections between proteins, tracing the path from upstream to downstream. Therefore, we propose a novel framework ProLLM that employs an LLM tailored for PPI for the first time. Specifically, we propose Protein Chain of Thought (ProCoT), which replicates the biological mechanism of signaling pathways as natural language prompts. ProCoT considers a signaling pathway as a protein reasoning process, which starts from upstream proteins and passes through several intermediate proteins to transmit biological signals to downstream proteins. Thus, we can use ProCoT to predict the interaction between upstream proteins and downstream proteins. The training of ProLLM employs the ProCoT format, which enhances the model's understanding of complex biological problems. In addition to ProCoT, this paper also contributes to the exploration of embedding replacement of protein sites in natural language prompts, and instruction fine-tuning in protein knowledge datasets. We demonstrate the efficacy of ProLLM through rigorous validation against benchmark datasets, showing significant improvement over existing methods in terms of prediction accuracy and generalizability. The code is available at: https://github.com/MingyuJ666/ProLLM.
연구 동기 및 목표
- 기존의 PPI 예측 방법이 직접적인 물리적 상호작용에만 초점을 맞추고 간접적이고 경로 기반의 연결을 忽시하는 한계를 해결하기 위해.
- 대규모 언어 모델(LLM)을 활용하여 복잡하고 순차적인 단백질 신호 전달 경로를 자연어 추론 체인으로 모델링하는 새로운 프레임워크를 개발하기 위해.
- 생물학적 지식 데이터셋에서 지시 프롬프팅 테이닝과 단백질 전용 임bedding을 통합하여 PPI 예측 성능을 향상시키기 위해.
- 기존 모델이 간과하는 紴합적이고 다단계적인 단백질 상호작용을 ProCoT가 얼마나 잘 포착하는지 평가하기 위해.
- 적절하게 생물학적으로 의미 있는 추론 구조로 프롬프팅된 LLM이 기존의 그래프 기반 및 CNN 기반 모델보다 PPI 예측에서 승리할 수 있음을 보여주기 위해.
제안 방법
- 신호 전달 경로를 상류에서 하류 단백질로 향하는 단계별 추론 순서로 표현하는 자연어 프롬프팅 형식인 ProCoT(Protein Chain of Thought)를 도입한다.
- 단백질 상호작용 데이터를 생물학적 신호 전달의 순차적 논리성을 담은 구조화된 자연어 프롬프트로 변환한다.
- 단백질 전용 임베딩을 ProtTrans에서 확보하여 시퀀스 수준의 생물학적 정보를 유지한다.
- 모델을 정제된 단백질 지식 데이터셋에서 지시 프롬프팅 테이닝을 통해 수행하여 PPI에 대한 추론 능력을 향상시킨다.
- 성능과 안정성을 평가하기 위해 여러 LLM 백본(Flan-T5-base, Flan-T5-large, Flan-T5-XL, LLaMA-v1-7b)을 평가한다.
- 제거 분석(ablation study)을 통해 ProCoT, 임베딩 교체, 지시 프롬프팅 테이닝의 기여도를 분리하여 성능에 미치는 영향을 정량화한다.
실험 결과
연구 질문
- RQ1생물학적 신호 전달 경로를 자연어 추론 체인으로 모델링하는 ProCoT 방식이 직접 상호작용 탐지 이상의 PPI 예측 성능 향상에 기여하는가?
- RQ2단백질 전용 임베딩과 지시 프롬프팅 테이닝의 통합이 다양한 PPI 데이터셋 간 일반화 능력 향상에 어떤 영향을 미치는가?
- RQ3임베딩 교체나 지시 프롬프팅 테이닝과 비교해 ProCoT의 상대적 기여도는 성능 향상에 얼마나 기여하는가?
- RQ4사슬의 사고 프롬프팅을 사용한 LLM이 기존의 GNN 및 CNN 기반 방법보다 PPI 예측 과제에서 승리하는가?
- RQ5크기와 생물학적 맥락이 다른 여러 벤치마크 데이터셋에서 ProLLM 프레임워크의 안정성과 일반화 능력은 어떠한가?
주요 결과
- Flan-T5-large 백본을 사용한 ProLLM는 STRING 데이터셋에서 최고의 마이크로-F1 스코어 87.12 ± 1.68을 기록하여 모든 다른 모델과 베이스라인을 압도했다.
- ProCoT 프롬프팅 형식 자체만으로도 성능 향상이 뚜렷했으며, ProCoT 없이 사용한 경우 마이크로-F1이 78.32 ± 2.65에서 ProCoT를 모두 적용한 경우 91.03 ± 1.63으로 상승했다.
- 제거 분석 결과 ProCoT가 성능 향상에 가장 큰 영향을 미쳤으며, 인간(Human) 데이터셋에서 베이스라인 대비 12.7포인트의 마이크로-F1 향상이 확인되었다.
- Flan-T5-large가 가장 뛰어난 전반적 성능를 보였으며, 더 큰 LLaMA-v1-7b 모델보다도 높은 정확도와 더 낮은 불안정성을 보였다.
- 지시 프롬프팅 테이닝과 임베딩 교체도 긍정적인 기여를 하였지만 ProCoT에 비해 영향도가 작았으며, 이는 추론 구조가 성능 향상의 주요 원동력임을 시사한다.
- 모델는 강력한 일반화 능력을 보였으며, 인간, SHS27K, SHS148K, STRING의 네 가지 모든 벤치마크 데이터셋에서 높은 마이크로-F1 스코어를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.