Skip to main content
QUICK REVIEW

[论文解读] Measuring photometric redshifts using galaxy images and Deep Neural Networks

B. Hoyle|arXiv (Cornell University)|Apr 27, 2015
Galaxies: Formation, Evolution, Phenomena参考文献 3被引用 4
一句话总结

本文提出一种深度学习方法,直接从完整的星系图像使用深度神经网络(DNN)估计光度红移,绕过传统的特征提取过程。该方法实现了具有竞争力的性能——中值残差 Δz ≈ 0.00,68% 散差 σ₆₈ ≈ 0.03,与当前最先进的机器学习技术相当,同时消除了用户定义的特征选择,并减少了流程中的人工偏差。

ABSTRACT

We propose a new method to estimate the photometric redshift of galaxies by using the full galaxy image in each measured band. This method draws from the latest techniques and advances in machine learning, in particular Deep Neural Networks. We pass the entire multi-band galaxy image into the machine learning architecture to obtain a redshift estimate that is competitive with the best existing standard machine learning techniques. The standard techniques estimate redshifts using post-processed features, such as magnitudes and colours, which are extracted from the galaxy images and are deemed to be salient by the user. This new method removes the user from the photometric redshift estimation pipeline. However we do note that Deep Neural Networks require many orders of magnitude more computing resources than standard machine learning architectures.

研究动机与目标

  • 开发一种绕过星系图像中手动特征提取的光度红移估计方法。
  • 评估深度神经网络是否能够仅使用原始图像数据而非预计算的星等和颜色,实现具有竞争力的红移精度。
  • 与标准机器学习架构相比,评估端到端DNN在估计星系红移方面的性能。
  • 探索使用完整图像作为输入的可行性,最大限度减少红移估计流程中的人为假设。

提出的方法

  • 该方法将完整的多波段星系图像(72×72×4像素)作为输入送入深度神经网络,绕过传统的光度特征提取过程。
  • 图像经过预处理,将像素强度映射到RGBA颜色通道以供网络输入。
  • 采用卷积神经网络架构,包含卷积(C)、修正线性单元(R)、最大池化(MP)、局部归一化(RN)和全连接(F)层。
  • 网络以每张图像的60×60×4随机裁剪作为输入,随后经过多个卷积层和非线性变换层。
  • 在第一个全连接层后应用一个丢弃率为 D₀.₆ 的丢弃层,以防止过拟合。
  • 最后一层使用Softmax激活函数,输出94个离散红移区间的概率,以概率最高的区间作为点估计值。

实验结果

研究问题

  • RQ1在星系图像上直接训练的深度神经网络能否实现与标准机器学习技术相当的光度红移精度?
  • RQ2与依赖用户定义特征(如星等和颜色)的传统方法相比,端到端基于图像的DNN性能如何?
  • RQ3去除人工特征工程对红移估计精度和鲁棒性有何影响?
  • RQ4DNN的残差统计量(如中值 Δz、散差、异常值率)与AdaBoost等成熟算法相比如何?

主要发现

  • DNN实现了中值红移残差 Δz = 0.00,表明点预测中系统偏差可忽略不计。
  • 红移残差的68%散差为 σ₆₈ = 0.030,与AdaBoost(一种最先进的标准机器学习方法)性能相当。
  • 95%散差为 σ₉₅ = 0.10,表明在大多数样本中均具有高精度。
  • 异常值率(定义为 |Δz / (1 + z_spec)| > 0.15 的星系比例)为1.71%,略高于AdaBoost的1.56%。
  • 该方法成功消除了对手动特征提取的需求,减少了人为偏差和流程复杂性。
  • 该方法计算开销较大,需在处理 ≤50,000 个星系后才需并行化,若无优化则限制了可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。