[论文解读] Estimating Galactic Distances From Images Using Self-supervised Representation Learning
本文提出一种自监督对比学习框架,利用未标注的SDSS数据从星系图像中估计光度红移,仅需全监督方法1/2至1/4的标注数据即达到最先进性能。通过在120万张未标注星系图像上预训练,并在50万张标注图像上微调,将MAD误差降低至0.00825,优于先前的全监督模型。
We use a contrastive self-supervised learning framework to estimate distances to galaxies from their photometric images. We incorporate data augmentations from computer vision as well as an application-specific augmentation accounting for galactic dust. We find that the resulting visual representations of galaxy images are semantically useful and allow for fast similarity searches, and can be successfully fine-tuned for the task of redshift estimation. We show that (1) pretraining on a large corpus of unlabeled data followed by fine-tuning on some labels can attain the accuracy of a fully-supervised model which requires 2-4x more labeled data, and (2) that by fine-tuning our self-supervised representations using all available data labels in the Main Galaxy Sample of the Sloan Digital Sky Survey (SDSS), we outperform the state-of-the-art supervised learning method.
研究动机与目标
- 开发一种自监督表示学习方法,无需依赖昂贵的光谱红移标签,即可从光度图像中估计星系距离。
- 证明在大规模未标注星系图像上进行预训练可提升下游光度红移估计的准确性。
- 表明自监督模型仅使用25%至50%的标注数据,即可达到或超越全监督模型的性能。
- 在SDSS主星系样本上建立一种新的基于图像的机器学习基准,用于光度红移估计。
- 公开发布处理后的星系图像、标签和训练模型,以降低天体物理机器学习研究的进入门槛。
提出的方法
- 该方法采用基于SimCLR风格数据增强的对比自监督学习框架,对五种光度波段(ugriz)的星系图像应用随机旋转和抖动等增强操作。
- 星系图像从每对象中心的107×107像素区域裁剪为64×64像素,保留原始SDSS像素分辨率。
- 使用ResNet-50编码器在SDSS DR9中的119万张未标注星系图像上进行预训练,通过对比损失学习语义有意义的视觉表征。
- 预训练完成后,编码器在502,977张带有光谱红移(z ≤ 0.4)的标注星系图像上进行微调,卷积层使用10倍小的初始起始学习率。
- 模型使用去消光后的星等,并在微调过程中应用数据增强,以提升鲁棒性与泛化能力。
- 性能通过标准指标评估:平均绝对偏差(MAD)和异常值比例(η),预测结果来自Softmax输出。
实验结果
研究问题
- RQ1从未标注星系图像中进行自监督表示学习,能否生成对光度红移估计有用的视觉特征?
- RQ2自监督预训练策略是否能在保持或提升准确性的前提下,减少对标注光谱数据的依赖?
- RQ3在完整SDSS主星系样本上微调自监督模型,是否能超越现有最先进全监督模型?
- RQ4针对星系尘埃和图像结构的特定数据增强,如何影响星系图像分析中的表征质量?
- RQ5自监督模型能否在星系图像数据集中实现有效的相似性搜索与异常检测?
主要发现
- 当在100%标注数据上微调时,自监督模型的光度红移MAD为0.00825,异常值比例η = 0.209,优于先前最先进水平。
- 仅使用25%的标注数据,自监督模型即可达到在100%数据上训练的全监督模型性能,展现出4倍的数据效率优势。
- 模型的预测偏差⟨Δz⟩可忽略不计,小于10−4,表明系统误差极小。
- 自监督表征支持有效的相似性搜索,嵌入空间中前10名最近邻常显示相似形态或识别出观测伪影。
- 该方法成功捕捉了星系图像中的语义结构,包括形态模式及异常现象(如卫星轨迹或宇宙射线击中)。
- 作者公开发布处理后的星系图像、红移标签和训练模型,以支持可复现性,并提升对SDSS数据的广泛可及性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。