[论文解读] Profile Prediction: An Alignment-Based Pre-Training Task for Protein Sequence Models
本文提出了一种名为轮廓预测(profile prediction)的新预训练任务,用于蛋白质序列模型,该任务将来自多序列比对(MSAs)的轮廓隐马尔可夫模型(HMM)发射概率作为标签进行预测。通过利用来自MSA的生物信息学归纳偏置,该方法在结构和同源性预测任务上优于掩码语言建模,表明基于比对的预训练可为进化和结构预测生成更优的表征。
For protein sequence datasets, unlabeled data has greatly outpaced labeled data due to the high cost of wet-lab characterization. Recent deep-learning approaches to protein prediction have shown that pre-training on unlabeled data can yield useful representations for downstream tasks. However, the optimal pre-training strategy remains an open question. Instead of strictly borrowing from natural language processing (NLP) in the form of masked or autoregressive language modeling, we introduce a new pre-training task: directly predicting protein profiles derived from multiple sequence alignments. Using a set of five, standardized downstream tasks for protein models, we demonstrate that our pre-training task along with a multi-task objective outperforms masked language modeling alone on all five tasks. Our results suggest that protein sequence models may benefit from leveraging biologically-inspired inductive biases that go beyond existing language modeling techniques in NLP.
研究动机与目标
- 解决蛋白质科学中未标注蛋白质序列数据量庞大与标注数据有限之间的不平衡问题。
- 克服受NLP启发的预训练任务(如掩码语言建模)在部分蛋白质预测任务中收益微弱的局限性。
- 开发一种基于生物学原理的预训练目标,利用多序列比对(MSAs)中的进化信息。
- 通过在自监督预训练中引入基于比对的归纳偏置,提升下游蛋白质预测任务的性能。
- 证明轮廓预测作为预训练任务,其生成的表征优于掩码语言建模在结构和同源性相关任务上的表现。
提出的方法
- 在预训练过程中,使用从多序列比对(MSAs)中提取的HMM轮廓作为监督目标。
- 对于每个输入蛋白质序列,通过数据库搜索(如PSI-BLAST)生成MSA,然后计算HMM中匹配状态和插入状态的发射概率。
- 使用基于Transformer的模型预测每个氨基酸位置的HMM发射概率,标签来源于MSA生成的轮廓。
- 应用预测发射概率与真实发射概率之间的KL散度损失,并按序列长度平均。
- 采用多任务目标,将轮廓预测与掩码语言建模联合训练,以同时优化两个任务。
- 在对比实验中保持模型架构、超参数和预训练数据完全一致,以隔离预训练目标的影响。
实验结果
研究问题
- RQ1基于预测MSA衍生HMM轮廓的预训练任务,是否能相比标准NLP启发式目标,提升蛋白质表征学习能力?
- RQ2轮廓预测是否能在与蛋白质结构和进化关系相关的下游任务中带来更好的性能?
- RQ3轮廓预测在以荧光和稳定性预测为代表的工程类任务中,与掩码语言建模相比表现如何?
- RQ4将轮廓预测与掩码语言建模结合,是否能在多样化的下游任务中实现更优性能?
- RQ5生物启发的预训练目标在蛋白质序列建模中,相较于通用的NLP基线目标,优势有多大?
主要发现
- 轮廓预测在全部五个下游任务中均优于掩码语言建模,其中在二级结构预测(0.74 vs. 0.72)和远距离同源检测(0.23 vs. 0.14)任务中提升最大。
- 在荧光任务中,轮廓预测的F1得分为0.38,优于掩码语言建模(0.25)和多任务学习(0.28)。
- 在稳定性任务中,掩码语言建模和多任务模型优于轮廓预测(0.63 vs. 0.55),表明掩码建模更适合精细工程类任务。
- 轮廓预测在二级结构和远距离同源任务上超越了所有先前的蛋白质特异性预训练任务(如Bepler & Berger, 2018;Lu et al., 2020)。
- 结合轮廓预测与掩码语言建模的多任务模型整体表现最佳,表明两种目标具有互补优势。
- 轮廓预测模型在二级结构和同源性任务上优于TAPE基准的Transformer和LSTM模型,仅在基于比对的基线模型(F1=0.80)之外,后者仍为最强模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。