[论文解读] Evolution Is All You Need: Phylogenetic Augmentation for Contrastive Learning
本文提出将分子进化作为生物序列对比自监督表示学习中的自然数据增强策略。通过将进化轨迹视为视图,该方法在同源序列之间最大化互信息,从而在无需昂贵实验标签的情况下生成稳健且功能相关的嵌入。
Self-supervised representation learning of biological sequence embeddings alleviates computational resource constraints on downstream tasks while circumventing expensive experimental label acquisition. However, existing methods mostly borrow directly from large language models designed for NLP, rather than with bioinformatics philosophies in mind. Recently, contrastive mutual information maximization methods have achieved state-of-the-art representations for ImageNet. In this perspective piece, we discuss how viewing evolution as natural sequence augmentation and maximizing information across phylogenetic "noisy channels" is a biologically and theoretically desirable objective for pretraining encoders. We first provide a review of current contrastive learning literature, then provide an illustrative example where we show that contrastive learning using evolutionary augmentation can be used as a representation learning objective which maximizes the mutual information between biological sequences and their conserved function, and finally outline rationale for this approach.
研究动机与目标
- 为解决自监督学习方法在生物序列中的不足,这些方法大多借鉴自然语言处理而非生物信息学原理。
- 探讨分子进化是否可作为对比学习中生物上合理且理论可靠的增强策略。
- 证明进化增强可使对比学习在序列及其保守功能之间最大化互信息。
- 为将进化作为自然的‘噪声信道’以生成对比学习中有信息量的视图,提供理论和生物学上的依据。
- 将进化增强定位为一种弱监督、通用的表示学习方法,适用于多种下游生物任务。
提出的方法
- 将分子进化视为自然的数据增强过程,通过从系统发育树中采样进化轨迹 $t_1, t_2 \sim \mathcal{T}$,生成两个视图 $v_1 = t_1(x)$ 和 $v_2 = t_2(x)$。
- 使用 InfoNCE 损失进行对比学习,以最大化两个进化视图之间的互信息,定义为 $\mathcal{L}_{\text{NCE}} = -\mathbb{E}_{v_1,v_2^+,v_2^-} \left[ \log \frac{\exp(f(g_1(v_1),g_2(v_2^+))}{\sum_{j=1}^N \exp(f(g_1(v_1),g_2(v_2^-_j)))} \right]$。
- 使用共享编码器 $g$ 将视图映射到潜在表示 $z_1 = g(v_1)$,$z_2 = g(v_2)$,对比目标旨在区分正样本对与 $N-1$ 个负样本对。
- 利用 InfoMin 原理选择共享互信息 $I(v_1;v_2)$ 最小但保留任务相关特征的视图,以系统发育距离作为控制参数。
- 将进化保守性作为下游标签的代理,实现隐式监督的对比学习而无需显式标签。
- 采用判别函数 $f$ 对正样本对进行评分,促使模型学习对干扰变化不敏感但对保守功能特征敏感的表示。
实验结果
研究问题
- RQ1分子进化能否在生物序列的对比自监督学习中有效用作数据增强策略?
- RQ2进化增强是否能生成保留序列与其保守生物学功能之间互信息的表示?
- RQ3与标准的 NLP 启发式增强相比,进化增强在理论基础和生物学相关性方面表现如何?
- RQ4在缺乏实验注释的情况下,进化视图能否作为下游标签的弱监督代理?
- RQ5在 InfoMin 原理下,控制视图间的系统发育距离在多大程度上能优化对比学习目标?
主要发现
- 进化增强为对比学习中生成视图提供了一种生物上合理且理论上有依据的方法,与基因型到表型的信息传递过程一致。
- 该方法实现了互信息 $I(v_1;v_2)$ 的下界,当视图源自具有保守功能元件的同源序列时,该互信息达到最大。
- 通过控制视图间的系统发育距离,该方法最小化了共享互信息,同时保留了功能相关特征,符合 InfoMin 原理。
- 进化保守性作为下游标签的语义代理,使弱监督对比学习成为可能,而无需显式标签。
- 该方法自然支持适用于多种下游任务的通用表示,如结构预测、功能注释和远距离同源性检测。
- 理论分析表明,在 InfoMin 框架下,当共享信息最小时且保留任务相关特征时,进化视图为最优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。