[论文解读] Adjusting for Confounding in Unsupervised Latent Representations of Images
该论文提出了一种对抗性训练方法,通过解耦批次效应和染色变异等干扰因素,从生物医学图像中学习无监督的、对干扰因子不变的表征。采用带有对抗性判别器的深度卷积自编码器,模型生成对干扰因子不变的潜在表征,同时保留生物信息,如在 λ=50 时达到 55.4% 的 MOA 预测准确率,显著高于随机猜测水平。
Biological imaging data are often partially confounded or contain unwanted variability. Examples of such phenomena include variable lighting across microscopy image captures, stain intensity variation in histological slides, and batch effects for high throughput drug screening assays. Therefore, to develop "fair" models which generalise well to unseen examples, it is crucial to learn data representations that are insensitive to nuisance factors of variation. In this paper, we present a strategy based on adversarial training, capable of learning unsupervised representations invariant to confounders. As an empirical validation of our method, we use deep convolutional autoencoders to learn unbiased cellular representations from microscopy imaging.
研究动机与目标
- 开发无监督表征学习方法,使其对生物医学图像数据中的干扰因素(如批次效应和染色变异)具有不变性。
- 解决因图像数据中存在混淆因素(特别是在高通量筛选和组织病理学中)导致机器学习模型泛化能力差的问题。
- 在无需昂贵人工标注的情况下,实现公平且无偏见的表征学习,支持发现新型细胞表型。
- 将对抗性去偏方法从有监督表征学习推广到无监督表征学习在图像数据中的应用。
提出的方法
- 训练一个深度卷积自编码器(CAE),从学习到的潜在代码中重建输入图像,以捕捉有意义的生物特征。
- 训练一个对抗性判别器,从潜在代码中预测干扰因子(如批次或染色强度),以促使 CAE 生成对干扰因子不变的表征。
- 联合训练目标结合了 CAE 重建损失和对抗性损失,通过超参数 λ 平衡两者,最小化 CAE 损失的同时最大化对抗性损失。
- 将优化问题表述为一个极小化-极大化问题:在最小化 CAE 参数 θ 的同时最大化判别器权重 w,确保潜在代码对干扰因子不具信息量。
- 通过使用对抗性回归器替代分类器,将该方法扩展到连续干扰因子。
- 在 BBBC021v1 显微成像数据集上验证了该方法,成功降低了批次效应的影响,同时保留了用于 MOA 预测的生物信号。
实验结果
研究问题
- RQ1对抗性训练能否被适配以在无需标注数据的情况下,从生物医学图像数据中学习无监督的、对干扰因子不变的表征?
- RQ2在保留生物相关性信息的前提下,多大程度上可以消除学习到的图像表征中的干扰因素(如批次效应和染色变异)?
- RQ3对抗性权重超参数 λ 的不同取值下,干扰因子不变性与生物信息保留之间的权衡如何体现?
- RQ4该方法能否推广到连续干扰因子(如组织病理学数据中的缺血时间)?
- RQ5所得到的表征是否能提升下游分类任务(如药物作用机制预测)的性能?
主要发现
- 在 λ=50 时,模型在预测分子作用机制(MOA)方面达到 55.435% 的准确率,是随机猜测水平的 3.6 倍,证明了对生物相关性信息的有效保留。
- 在 λ=50 时,批次预测准确率下降至 35.870%,表明对批次效应干扰因子具有强不变性,显著低于 λ=0 时的 64.130%。
- 该方法成功从潜在空间中去除了干扰信号,表现为随着 λ 增大,批次准确率急剧下降,同时保持了较高的 MOA 预测性能。
- 该方法可推广至连续干扰因子:在 GTEx 组织病理学数据中,发现缺血时间与无监督表征之间的相关系数为 r=0.18(p=4.9×10−150),证实了连续干扰因子的存在。
- 即使在高 λ 值下,模型在 MOA 预测中的表现仍优于随机猜测三倍以上,确认所学表征保留了有意义的生物结构。
- 该方法通过避免依赖预标注数据,在无监督范式下实现了新型表型的发现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。