Skip to main content
QUICK REVIEW

[论文解读] Enhancing the efficiency of protein language models with minimal wet-lab data through few-shot learning

Ziyi Zhou, Liang Zhang|arXiv (Cornell University)|Feb 3, 2024
Machine Learning in BioinformaticsBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

该论文提出FSFP,一种少样本微调策略,仅通过数十个单一位点突变的湿实验测量数据即可增强蛋白质语言模型。通过结合元迁移学习、学习排序与参数高效微调,FSFP在87个深度突变扫描数据集中显著提升了预测准确率,即使在极端数据稀缺条件下,也优于无监督和有监督基线方法。

ABSTRACT

Accurately modeling the protein fitness landscapes holds great importance for protein engineering. Recently, due to their capacity and representation ability, pre-trained protein language models have achieved state-of-the-art performance in predicting protein fitness without experimental data. However, their predictions are limited in accuracy as well as interpretability. Furthermore, such deep learning models require abundant labeled training examples for performance improvements, posing a practical barrier. In this work, we introduce FSFP, a training strategy that can effectively optimize protein language models under extreme data scarcity. By combining the techniques of meta-transfer learning, learning to rank, and parameter-efficient fine-tuning, FSFP can significantly boost the performance of various protein language models using merely tens of labeled single-site mutants from the target protein. The experiments across 87 deep mutational scanning datasets underscore its superiority over both unsupervised and supervised approaches, revealing its potential in facilitating AI-guided protein design.

研究动机与目标

  • 为解决预训练蛋白质语言模型在预测蛋白质适应度景观时性能有限且可解释性不足的问题。
  • 克服模型微调所需大量标注实验数据带来的实际障碍。
  • 开发一种训练策略,在仅使用极少量湿实验数据(具体为仅数十个单一位点突变测量值)的情况下实现高性能。
  • 在数据稀缺条件下,提升蛋白质语言模型在人工智能引导的蛋白质设计中的效率与泛化能力。
  • 整合元学习、排序损失与参数高效微调,以实现对目标蛋白质的最优适应,且数据需求极低。

提出的方法

  • FSFP采用元迁移学习,使蛋白质语言模型能够仅用少量标注样本快速适应新蛋白质。
  • 引入学习排序损失函数,使模型预测与蛋白质变体的相对适应度顺序对齐。
  • 采用参数高效微调技术,仅更新模型参数的小部分子集,降低计算成本并防止过拟合。
  • 在多样化的蛋白质家族上进行训练,以实现对不同类型目标蛋白质和突变的泛化能力。
  • 以预训练蛋白质语言模型作为骨干网络,利用来自深度突变扫描实验的极少量标注数据进行微调。
  • 该框架设计为可扩展,适用于多种蛋白质工程任务,且实验验证数据有限。

实验结果

研究问题

  • RQ1蛋白质语言模型是否仅通过数十个标注的单一位点突变体即可实现对适应度景观的高精度预测?
  • RQ2结合元学习、排序损失与参数高效微调,如何在数据稀缺条件下提升模型泛化能力?
  • RQ3在少样本蛋白质适应度预测中,FSFP是否优于无监督预训练与完全监督微调?
  • RQ4FSFP在仅使用极少实验数据的情况下,能否在多样化的蛋白质家族与突变类型间实现良好泛化?
  • RQ5学习排序损失的整合是否能增强模型预测的可解释性与适应度评分的排序性能?

主要发现

  • FSFP在87个深度突变扫描数据集中显著提升了蛋白质适应度预测的准确率,即使仅使用10至50个标注的单一位点突变体。
  • 该方法在低数据场景下优于无监督预训练与标准监督微调,尤其在数据稀缺条件下表现突出。
  • FSFP在多个基准数据集上达到最先进性能,证明其在多样化蛋白质家族中的卓越泛化能力。
  • 采用学习排序损失使模型预测与生物适应度顺序更匹配,提升了模型预测的可解释性。
  • 参数高效微调实现了低计算开销下的有效适应,同时降低了过拟合风险。
  • 元学习使模型能够快速适应新蛋白质,证实该方法在少样本场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。