[论文解读] Data Augmentation for Compositional Data: Advancing Predictive Models of the Microbiome
本文提出了针对组成数据(CoDa)——如微生物组组成——的新型数据增强技术:Aitchison Mixup、组合CutMix 和随机子组成。通过利用单纯形上的Aitchison几何结构,并将这些方法整合到监督学习与对比学习流程中,作者在关键的微生物组疾病预测任务(包括结直肠癌、2型糖尿病和克罗恩病)中实现了最先进性能,部分模型的AUC提升超过20%。
Data augmentation plays a key role in modern machine learning pipelines. While numerous augmentation strategies have been studied in the context of computer vision and natural language processing, less is known for other data modalities. Our work extends the success of data augmentation to compositional data, i.e., simplex-valued data, which is of particular interest in the context of the human microbiome. Drawing on key principles from compositional data analysis, such as the Aitchison geometry of the simplex and subcompositions, we define novel augmentation strategies for this data modality. Incorporating our data augmentations into standard supervised learning pipelines results in consistent performance gains across a wide range of standard benchmark datasets. In particular, we set a new state-of-the-art for key disease prediction tasks including colorectal cancer, type 2 diabetes, and Crohn's disease. In addition, our data augmentations enable us to define a novel contrastive learning model, which improves on previous representation learning approaches for microbiome compositional data. Our code is available at https://github.com/cunningham-lab/AugCoDa.
研究动机与目标
- 为解决组成数据(CoDa)——尤其在微生物组研究中——缺乏有效数据增强策略的问题。
- 开发尊重相对丰度数据单纯形几何结构的数据增强技术,确保统计与几何上的有效性。
- 在样本量小、维度高的情况下,提升监督学习与对比学习模型在微生物组数据集上的性能。
- 通过数据增强建立微生物组相关疾病预测建模的新最先进水平。
- 通过基于组成增强的新型对比学习框架,实现微生物组数据的更好表征学习。
提出的方法
- 提出Aitchison Mixup,一种在Aitchison单纯形几何中对两个组成数据点进行线性插值的数据增强方法,保持相对比例不变。
- 引入组合CutMix,通过使用Aitchison几何将一个数据点的部分特征替换为另一数据点的特征,以维持组成完整性。
- 开发随机子组成策略,从每个数据点中随机选择特征子集(子组成)以生成增强样本,提升对特征子集变化的鲁棒性。
- 将这些增强方法集成到标准监督学习流程中,提升在基准数据集上的泛化能力与性能。
- 通过为同一原始样本生成增强视图作为正样本对、不同样本间生成负样本对,并使用对比损失学习不变表征,将增强方法适配至对比学习。
- 在2,000个周期内使用Adam优化器与早停策略,采用标准超参数,通过线性评估与微调协议在多个数据集上进行评估。
实验结果
研究问题
- RQ1为计算机视觉与自然语言处理设计的数据增强技术能否有效适配至组成数据(如微生物组相对丰度)?
- RQ2如何利用单纯形的几何结构(Aitchison几何)设计出有意义且有效的组成数据增强方法?
- RQ3这些新型增强方法是否在微生物组疾病预测任务的监督学习中带来一致的性能提升?
- RQ4这些增强方法能否用于训练有效的对比表征学习模型,用于微生物组CoDa?
- RQ5所提出的增强方法是否能提升在低样本量、高维微生物组数据集中的泛化能力与鲁棒性?
主要发现
- 所提出的增强方法——Aitchison Mixup、组合CutMix与随机子组成——在来自微生物组学习仓库的12个标准微生物组基准数据集中一致提升了性能。
- 在使用所提增强方法时,DeepCoDa在结直肠癌分类任务中测试AUC绝对提升超过10%,在2型糖尿病任务中提升超过20%。
- 基于随机子组成的对比学习框架在所有任务的线性评估与微调协议中,均优于DeepMicro与随机初始化模型。
- 平均而言,对比模型在线性评估中达到78% AUC,在微调中达到77%,而DeepMicro分别为75%与76%。
- 该方法在关键疾病预测任务(包括结直肠癌、2型糖尿病与克罗恩病)中创下新最先进水平,且提升具有统计显著性。
- 结果表明,数据增强是一种强大且低成本的方法,可显著提升微生物组研究中的模型性能,尤其在数据稀缺的场景下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。