[论文解读] Contrastive losses as generalized models of global epistasis
本文提出使用监督对比损失——特别是Bradley-Terry损失——作为一种数据高效的方法,以恢复在全局上位性扭曲数据时生物序列中潜在排序函数的底层结构,尤其适用于全局上位性导致数据扭曲的情况。结果表明,对比损失在学习稀疏、全局上位性适应度景观方面优于均方误差(MSE)损失,且在FLIP等基准任务中表现一致提升,即使在数据极度稀疏的情况下亦是如此。
Fitness functions map large combinatorial spaces of biological sequences to properties of interest. Inferring these multimodal functions from experimental data is a central task in modern protein engineering. Global epistasis models are an effective and physically-grounded class of models for estimating fitness functions from observed data. These models assume that a sparse latent function is transformed by a monotonic nonlinearity to emit measurable fitness. Here we demonstrate that minimizing supervised contrastive loss functions, such as the Bradley-Terry loss, is a simple and flexible technique for extracting the sparse latent function implied by global epistasis. We argue by way of a fitness-epistasis uncertainty principle that the nonlinearities in global epistasis models can produce observed fitness functions that do not admit sparse representations, and thus may be inefficient to learn from observations when using a Mean Squared Error (MSE) loss (a common practice). We show that contrastive losses are able to accurately estimate a ranking function from limited data even in regimes where MSE is ineffective and validate the practical utility of this insight by demonstrating that contrastive loss functions result in consistently improved performance on benchmark tasks.
研究动机与目标
- 解决在高维生物序列空间中,从有限实验数据学习适应度函数的挑战。
- 探究为何在受全局上位性影响的场景中,均方误差(MSE)损失在适应度函数变得在上位性表示中密集时会失效。
- 提出并验证对比损失(尤其是Bradley-Terry)作为学习潜在排序函数的更数据高效替代方案。
- 建立全局上位性与稀疏上位性表示和观测适应度数据之间不相容性的理论联系。
- 在真实世界蛋白质适应度预测基准中,展示对比损失相对于MSE的实际优越性。
提出的方法
- 本文将全局上位性建模为将稀疏潜在适应度函数转换为观测适应度的单调非线性变换,导致在上位性基下表示变得非稀疏。
- 提出适应度-上位性不确定性原理,表明适应度域中集中分布的适应度值意味着在上位性(图傅里叶)基下表示为密集,使得稀疏建模变得不可行。
- 核心方法是通过最小化监督对比损失(特别是Bradley-Terry)来恢复潜在排序函数,且不假设非线性或潜在函数的参数形式。
- 通过在不同数据稀疏度下进行模拟验证该方法,并在包含多个蛋白质适应度数据集的FLIP基准上与MSE训练进行比较。
- 将该方法应用于基于序列数据训练的卷积神经网络(CNNs),并通过包含非突变序列位置的消融实验进行分析。
- 通过Spearman等级相关系数和测试集上的top-10%召回率评估性能,以衡量排序能力和高精度预测表现。
实验结果
研究问题
- RQ1在全局上位性扭曲数据时,对比损失(如Bradley-Terry)是否能优于MSE学习适应度函数?
- RQ2为何MSE在数据稀缺条件下无法学习受全局上位性影响的适应度函数,特别是当适应度函数在上位性表示中变得密集时?
- RQ3在不假设非线性或潜在函数形式的前提下,能否通过对比学习从观测适应度数据中恢复潜在排序函数?恢复程度如何?
- RQ4适应度-上位性不确定性原理如何解释稀疏上位性模型与全局上位性适应度函数之间的不相容性?
- RQ5在真实世界蛋白质工程基准中,对比训练是否相比MSE在高精度预测(如top 10%适应度序列)方面表现更优?
主要发现
- 对比损失,尤其是Bradley-Terry,在所有FLIP基准任务中均一致优于MSE,Spearman相关系数表现更优,无一例表现更差。
- Bradley-Terry损失的top-10%召回率高于MSE,表明其在识别最高适应度序列方面表现更优。
- 模拟结果证实,全局上位性会产生在上位性基下表示密集的适应度函数,导致在数据稀缺时难以通过MSE学习。
- 适应度-上位性不确定性原理解释了为何此类函数无法在上位性术语中实现稀疏表示,从而为采用替代学习目标提供了理论依据。
- 该方法对噪声具有鲁棒性,如附录F中的病态噪声场景所示,表明其在真实实验环境中的实际可行性。
- 排除非突变序列位置通常能提升性能并降低计算成本,仅在特定划分中带来微小增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。