[论文解读] Towards Galaxy Foundation Models with Hybrid Contrastive Learning
该论文提出了一种混合对比学习框架,将自监督表示学习与基于 Galaxy Zoo 项目 9650 万张星系形态标签(GZ-Evo v0.1)的监督预训练相结合。通过将 BYOL 适配为联合优化对比损失与回归损失,该方法在仅使用 750 个标签的情况下,下游准确率提升 6%,在低数据场景下显著优于仅使用标准预训练或对比学习的方法。
New astronomical tasks are often related to earlier tasks for which labels have already been collected. We adapt the contrastive framework BYOL to leverage those labels as a pretraining task while also enforcing augmentation invariance. For large-scale pretraining, we introduce GZ-Evo v0.1, a set of 96.5M volunteer responses for 552k galaxy images plus a further 1.34M comparable unlabelled galaxies. Most of the 206 GZ-Evo answers are unknown for any given galaxy, and so our pretraining task uses a Dirichlet loss that naturally handles unknown answers. GZ-Evo pretraining, with or without hybrid learning, improves on direct training even with plentiful downstream labels (+4% accuracy with 44k labels). Our hybrid pretraining/contrastive method further improves downstream accuracy vs. pretraining or contrastive learning, especially in the low-label transfer regime (+6% accuracy with 750 labels).
研究动机与目标
- 开发一种星系形态的基础模型,利用来自多个 Galaxy Zoo 活动的现有、多样化公民科学标签。
- 通过混合自监督与监督预训练,提升下游星系形态任务中的零样本与少样本迁移性能。
- 通过建模非可交换的志愿者响应,缓解不同 Galaxy Zoo 活动之间的分布偏移问题。
- 构建一种可扩展、通用的表示学习框架,适用于未来未知的星系形态任务。
- 证明将对比不变性与监督信号结合,可在标签稀缺场景下取得更优性能。
提出的方法
- 将 BYOL 对比学习框架扩展,以包含针对 206 项不同星系形态任务的监督回归损失。
- 采用狄利克雷损失处理 9650 万条志愿者响应中的缺失或未知答案,提升在稀疏标签上的训练鲁棒性。
- 在 GZ-Evo v0.1 上进行训练,该数据集包含来自五台望远镜和四个 Galaxy Zoo 活动的 55.2 万张标注星系与 134 万张未标注星系。
- 对对比视图应用数据增强,同时在回归头中保留同一图像的监督信号。
- 使用共享主干网络提取对比与监督目标的特征,实现在不同任务间共享表示。
- 在下游任务上使用少量标注数据微调混合模型,并在低样本场景下评估性能。
实验结果
研究问题
- RQ1将对比自监督与现有星系形态标签的监督预训练相结合,能否提升在新相关任务中的下游性能?
- RQ2在标签数量有限的场景下,该混合方法相较于纯对比学习或纯监督预训练表现如何?
- RQ3狄利克雷损失能否有效处理不同 Galaxy Zoo 活动中志愿者响应的高稀疏性与非可交换性?
- RQ4在涵盖多活动的广泛星系形态标签数据集上进行预训练,是否能产生比任务特定预训练更具泛化能力的表示?
- RQ5该混合方法在星系形态分类的少样本迁移任务中,性能提升程度如何?
主要发现
- 即使不采用混合学习,GZ-Evo 预训练在使用 4.4 万张标注样本时,相比直接训练可将下游准确率提升 +4%。
- 在仅使用 750 个标签进行微调时,混合预训练/对比学习方法相比标准预训练或仅对比学习方法,准确率提升 +6%。
- 该模型在新任务上表现出强大泛化能力,例如在未参与预训练的 Galaxy Zoo Rings 项目中检测星环。
- 狄利克雷损失有效处理了志愿者响应的高稀疏性,其中每张星系图像的 206 项答案中多数为未知。
- 在低标签场景下,该方法优于基线模型,表明所学表示具有强大迁移能力。
- 该框架支持构建星系形态的基础模型,可针对未来未知任务进行微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。