Skip to main content
QUICK REVIEW

[论文解读] Pre-training Protein Language Models with Label-Agnostic Binding Pairs Enhances Performance in Downstream Tasks

Modestas Filipavicius, Matteo Manica|arXiv (Cornell University)|Dec 5, 2020
Machine Learning in Bioinformatics被引用 11
一句话总结

本文提出在仅使用掩码语言建模(MLM)的条件下,对基于RoBERTa的蛋白质语言模型进行预训练,训练数据为来自STRING数据库的已知结合与非结合蛋白质对的混合数据,且在预训练过程中不使用显式的结合标签。该方法在蛋白质-蛋白质结合预测、TCR-表位结合、亚细胞定位以及远距离同源分类等下游任务中达到最先进性能,表明注意力机制能从序列对中隐式学习到与结合相关的模式。

ABSTRACT

Less than 1% of protein sequences are structurally and functionally annotated. Natural Language Processing (NLP) community has recently embraced self-supervised learning as a powerful approach to learn representations from unlabeled text, in large part due to the attention-based context-aware Transformer models. In this work we present a modification to the RoBERTa model by inputting during pre-training a mixture of binding and non-binding protein sequences (from STRING database). However, the sequence pairs have no label to indicate their binding status, as the model relies solely on Masked Language Modeling (MLM) objective during pre-training. After fine-tuning, such approach surpasses models trained on single protein sequences for protein-protein binding prediction, TCR-epitope binding prediction, cellular-localization and remote homology classification tasks. We suggest that the Transformer's attention mechanism contributes to protein binding site discovery. Furthermore, we compress protein sequences by 64% with the Byte Pair Encoding (BPE) vocabulary consisting of 10K subwords, each around 3-4 amino acids long. Finally, to expand the model input space to even larger proteins and multi-protein assemblies, we pre-train Longformer models that support 2,048 tokens. Further work in token-level classification for secondary structure prediction is needed. Code available at: https://github.com/PaccMann/paccmann_proteomics

研究动机与目标

  • 通过在不使用显式标签的情况下,对结合与非结合蛋白质对的混合数据进行预训练,以提升蛋白质语言模型在下游任务中的性能。
  • 探索使用序列对进行自监督学习是否能增强对生物相关模式(如蛋白质结合位点)的发现能力。
  • 通过预训练支持最多2,048个标记的Longformer变体,实现对长序列蛋白质及多蛋白复合物的建模。
  • 通过使用10K子词词汇表的字节对编码(BPE)方法,将序列表示空间减少64%。
  • 研究注意力机制在通过自监督预训练检测结构基序(如α-螺旋)中的作用。

提出的方法

  • 仅使用掩码语言建模(MLM)目标,在来自STRING数据库的蛋白质序列对混合数据上预训练RoBERTa模型,其中一条序列是已知结合体,另一条是随机序列。
  • 采用BPE子词分词方案,使用10K词汇表,将蛋白质序列空间压缩64%,将3–4个氨基酸片段表示为单个标记。
  • 在下游任务(包括蛋白质-蛋白质结合预测、TCR-表位结合、亚细胞定位和远距离同源分类)上微调预训练模型。
  • 训练一个支持2,048个标记上下文窗口的Longformer变体,以支持长蛋白质序列和多蛋白复合物。
  • 分析各层注意力模式,识别与α-螺旋相关的周期性4氨基酸模式等基序。
  • 对比微调前后注意力模式的变化,评估其关注焦点的变化,如减少对BOS/EOS标记的过度依赖,以及增加对功能相关残基(如Q、K和C)的关注。

实验结果

研究问题

  • RQ1在未标注蛋白质对(无结合状态标签)上预训练蛋白质语言模型,是否能提升下游分类任务的性能?
  • RQ2自监督模型中的注意力机制是否能隐式学习到检测蛋白质结合位点和结构基序(如α-螺旋)的能力?
  • RQ3使用更大、更深的模型在更大数据集上进行较少训练轮次,是否优于在较小数据集上训练更长时间的较小、较浅模型?
  • RQ4基于BPE的子词分词是否能显著减少序列表示空间,同时保留生物信息?
  • RQ5微调如何改变预训练模型的注意力模式,特别是在关注生物相关残基和减少对特殊标记过度依赖方面?

主要发现

  • 该模型在蛋白质-蛋白质结合预测、TCR-表位结合、亚细胞定位和远距离同源分类任务中,优于单序列预训练模型。
  • 在序列对上进行预训练可产生检测与α-螺旋相关的周期性4氨基酸模式的注意力模式,表明隐式学习到了二级结构信息。
  • 微调后减少了对BOS和EOS标记的过度依赖,并增加了对结合区域中功能相关残基(如Q、K和C)的关注。
  • 尽管在预训练阶段未使用显式结合标签,该模型仍取得优异性能,表明在成对序列上使用MLM目标可捕捉到与结合相关的表征。
  • Longformer变体成功支持长达2,048个标记的序列,实现了对长蛋白质和多蛋白复合物的建模。
  • 本研究证明,使用更大、更深的模型在更大数据集上进行较少轮次预训练,可获得优于在较小数据集上长时间训练较小模型的下游性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。