Skip to main content
QUICK REVIEW

[论文解读] A citizen-science approach to muon events in imaging atmospheric Cherenkov telescope data: the Muon Hunter

Q. Feng, J. F. Jarvis|arXiv (Cornell University)|Aug 21, 2017
Astrophysics and Cosmic Phenomena参考文献 6被引用 4
一句话总结

本文介绍了Muon Hunter项目,这是Zooniverse平台上的一个公民科学项目,通过志愿者对VERITAS成像大气契伦科夫望远镜数据中的μ子事件进行分类,训练卷积神经网络(CNN)以提升μ子环的检测性能。该模型使用众包标签训练,测试准确率达到97%,优于先前使用标准分析数据训练的CNN模型。

ABSTRACT

Event classification is a common task in gamma-ray astrophysics. It can be treated with rapidly-advancing machine learning algorithms, which have the potential to outperform traditional analysis methods. However, a major challenge for machine learning models is extracting reliably labelled training examples from real data. Citizen science offers a promising approach to tackle this challenge. We present "Muon Hunter", a citizen science project hosted on the Zooniverse platform, where VERITAS data are classified multiple times by individual users in order to select and parameterize muon events, a product from cosmic ray induced showers. We use this dataset to train and validate a convolutional neural-network model to identify muon events for use in monitoring and calibration. The results of this work and our experience of using the Zooniverse are presented.

研究动机与目标

  • 解决高能伽马射线天体物理学中机器学习训练数据可靠标注的挑战。
  • 开发一种可扩展、基于社区的μ子环事件标注方法,用于成像大气契伦科夫望远镜数据。
  • 通过使用基于公民科学标注训练的卷积神经网络(CNN)提升μ子事件分类性能。
  • 探索利用志愿者共识生成高质量监督学习训练数据的可行性,应用于高能天体物理学。
  • 通过标准分析和公民科学识别的μ子事件,实现IACT的校准与监测。

提出的方法

  • Zooniverse平台上的志愿者对16,000张VERITAS图像进行了分类,标记μ子环候选事件,并回答关于环完整性与包含性的后续问题。
  • 每张图像获得15次独立分类,通过投票聚合实现统计置信度估计。
  • 将获得10次及以上“存在μ子”投票的图像标记为μ子事件,其余标记为非μ子事件用于训练。
  • 使用从原始499像素六边形PMT布局中提取的54×54像素图像,对VGG风格的CNN进行训练。
  • CNN采用平均池化、Dropout层以及两层全连接头,实现对μ子与非μ子事件的二分类。
  • 通过测试准确率评估模型性能,并与基于标准VEGAS分析流程标签训练的CNN进行比较。

实验结果

研究问题

  • RQ1公民科学能否为成像大气契伦科夫望远镜数据中的μ子环事件提供可靠且高质量的标注?
  • RQ2基于公民科学标注训练的CNN模型性能与基于标准分析标注训练的模型相比如何?
  • RQ3志愿者之间的共识投票能否降低标注模糊性并提升训练数据质量?
  • RQ4通过志愿者输入识别出的低噪声、单μ子环图像,μ子环检测性能能提升到何种程度?
  • RQ5能否在相同数据上有效训练回归模型以预测μ子环半径,从而提高IACT的校准精度?

主要发现

  • 基于公民科学标注训练的CNN模型测试准确率约为97%,优于先前使用标准VEGAS标注训练的模型(准确率约95%)。
  • 志愿者分类分布显示,85%的图像获得一致投票,表明标注具有高度一致性与可靠性。
  • 将获得10次及以上“存在μ子”投票的图像作为新训练集,得到更干净、更少模糊的标注数据集,有利于模型训练。
  • 本项目证明,公民科学可有效解决高能天体物理学中机器学习的数据标注瓶颈问题。
  • 在更大规模、经公民科学增强的数据集上训练的模型表现出更好的泛化能力,表明相比先前较小的数据集,其过拟合程度更低。
  • 作者识别出一条可行路径,可在单μ子环图像上训练回归模型以预测环半径,从而提升IACT的校准精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。