[论文解读] Modeling Protein Using Large-scale Pretrain Language Model
本文提出ProteinLM,一种大规模预训练语言模型,用于蛋白质序列建模,通过利用进化尺度的数据捕捉生物与结构信息。通过在下游任务(如二级结构预测、远距离同源检测和稳定性预测)上微调,参数量高达30亿的ProteinLM实现了最先进性能,相较于先前模型(如TAPE和ProtTrans)展现出更优的长距离依赖建模能力。
Protein is linked to almost every life process. Therefore, analyzing the biological structure and property of protein sequences is critical to the exploration of life, as well as disease detection and drug discovery. Traditional protein analysis methods tend to be labor-intensive and time-consuming. The emergence of deep learning models makes modeling data patterns in large quantities of data possible. Interdisciplinary researchers have begun to leverage deep learning methods to model large biological datasets, e.g. using long short-term memory and convolutional neural network for protein sequence classification. After millions of years of evolution, evolutionary information is encoded in protein sequences. Inspired by the similarity between natural language and protein sequences, we use large-scale language models to model evolutionary-scale protein sequences, encoding protein biology information in representation. Significant improvements are observed in both token-level and sequence-level tasks, demonstrating that our large-scale model can accurately capture evolution information from pretraining on evolutionary-scale individual sequences. Our code and model are available at https://github.com/THUDM/ProteinLM.
研究动机与目标
- 开发一种可扩展的大规模蛋白质序列预训练框架,受自然语言建模启发。
- 解决传统蛋白质分析方法存在的劳动密集和计算成本高的局限。
- 通过从大规模无标签数据中捕捉进化与结构模式,改进蛋白质序列的表征学习。
- 研究模型规模与架构对蛋白质建模任务性能的影响。
- 为在有限计算资源下训练大规模蛋白质语言模型提供经验性超参数选择指导。
提出的方法
- 在包含超过30亿条蛋白质序列的PFAM数据库上预训练基于Transformer的的语言模型。
- 采用掩码语言建模(MLM)作为预训练目标,从原始氨基酸序列中学习上下文表征。
- 利用自注意力机制建模蛋白质序列中的长距离依赖关系,类似于自然语言处理中的Transformer模型。
- 训练不同深度(8–32层)和宽度(512–3072隐藏维度)的模型,以研究性能与计算成本之间的权衡。
- 在TAPE基准的五个标准化生物任务上微调预训练模型:二级结构预测、接触预测、远距离同源检测、荧光性和稳定性预测。
- 通过受控的消融实验分析模型深度、宽度和训练时长对性能与收敛性的影响。
实验结果
研究问题
- RQ1大规模预训练语言模型能否有效捕捉来自大规模无标签蛋白质序列的进化与结构信息?
- RQ2模型规模(深度与宽度)如何影响蛋白质表征学习任务的性能?
- RQ3ProteinLM在下游蛋白质序列建模任务中,能在多大程度上超越现有模型(如TAPE和ProtTrans)?
- RQ4在计算资源有限的情况下,训练大规模蛋白质语言模型的最优超参数是什么?
- RQ5该模型能否准确预测蛋白质结构中的长距离接触,表明其对长距离依赖关系的有效建模?
主要发现
- 参数量为30亿的ProteinLM在二级结构预测任务中达到79%的准确率(Q-3),超过TAPE的73%,优于较小参数量的模型。
- 在远距离同源检测任务中,最大配置的模型F1得分为0.298(P@L/5),显著优于TAPE的0.26。
- 在稳定性预测任务中,ProteinLM(3B)的Spearman等级相关系数为0.79,优于TAPE的0.73,表明回归性能更优。
- 接触图可视化结果表明,ProteinLM-3B能有效捕捉长距离相互作用,沿反对角线呈现强信号,而TAPE则遗漏了大量长距离接触。
- 隐藏层大小为2048、深度为24层的模型(ProteinLM-3B)在性能与训练效率之间达到最佳平衡,P@L/5指标相比TAPE提升5.5%。
- 经验分析表明,模型深度(Transformer层数)对性能的影响大于宽度(隐藏层大小),最优配置位于8–24层与512–3072隐藏单元之间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。