QUICK REVIEW
[论文解读] Random Embeddings and Linear Regression can Predict Protein Function
Tianyu Lu, Alex X. Lu|arXiv (Cornell University)|Apr 25, 2021
Microplastics and Plastic Pollution参考文献 16被引用 4
一句话总结
该论文表明,未经预训练学习的随机嵌入在14项多样化的蛋白质功能预测任务中,性能可与当前最先进的预训练蛋白质语言模型相媲美。通过在线性回归中使用独热编码或随机初始化的嵌入,作者表明这些简单的基线模型在泛化和外推至未见突变方面优于或匹配预训练模型,从而挑战了昂贵预训练的必要性。
ABSTRACT
Large self-supervised models pretrained on millions of protein sequences have recently gained popularity in generating embeddings of protein sequences for protein function prediction. However, the absence of random baselines makes it difficult to conclude whether pretraining has learned useful information for protein function prediction. Here we show that one-hot encoding and random embeddings, both of which do not require any pretraining, are strong baselines for protein function prediction across 14 diverse sequence-to-function tasks.
研究动机与目标
- 评估未经预训练的随机嵌入是否可作为蛋白质功能预测的强基线。
- 评估大规模预训练带来的性能提升是否真正源于学习到的生物物理表征,还是仅仅源于高维随机投影。
- 调查尽管未进行训练,某些随机嵌入架构是否优于其他架构。
- 在蛋白质功能预测的多样化回归任务中,比较独热编码与随机嵌入相对于预训练模型的性能表现。
- 通过展示未经训练模型的优异表现,挑战预训练对于有效蛋白质表征学习必不可少的假设。
提出的方法
- 本研究使用预训练的蛋白质语言模型(ProtBert、CPCProt、Bepler)及其随机初始化的对应版本作为嵌入函数。
- 对于每个模型,嵌入层使用随机权重初始化且不进行微调;仅训练顶层的线性回归头。
- 使用独热编码作为基线,通过保留完整的序列长度 × 21 维度来保持全部位置信息。
- 顶层为一个线性回归器,基于固定维度的嵌入预测连续的蛋白质功能值(如荧光强度、催化活性、熔解温度)。
- 该方法在14个多样化数据集上评估性能,包括对外部未见残基变异和上位性突变的外推。
- 使用标准回归指标评估模型性能,结果取三次随机重复实验的平均值。
实验结果
研究问题
- RQ1未经任何预训练的随机嵌入是否可在蛋白质功能预测中与当前最先进的预训练模型表现相当?
- RQ2某些随机嵌入架构是否优于其他架构?如果是,原因是什么?
- RQ3预训练模型的性能是源于学习到的生物物理表征,还是仅仅源于高维随机投影?
- RQ4在泛化至包含未观测残基变异或上位性突变的序列时,独热编码与随机嵌入的表现如何比较?
- RQ5在独立于预训练的前提下,嵌入维度的数量在多大程度上影响模型性能?
主要发现
- 在14项多样化蛋白质功能预测任务中,包括对外部未见残基变异和上位性突变的外推,随机嵌入的性能与或优于预训练模型。
- 保留全部位置信息的独热编码表现强劲,表明局部序列模式对功能预测至关重要,而嵌入平均化可能破坏重要信息。
- 随机嵌入的一致成功支持了Cover定理,表明即使未学习,高维随机投影仍可线性可分且具有预测能力。
- 某些随机嵌入架构优于其他架构,表明架构设计本身在无预训练条件下也会影响性能。
- 结果挑战了预训练对于有效蛋白质表征学习必不可少的假设,因为未经训练的模型可达到或超越预训练基线。
- 本研究强调了在表征学习中使用随机基线的重要性,因为它们揭示了性能提升可能源于维度本身,而非生物学上有意义的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。