[论文解读] CytoImageNet: A large-scale pretraining dataset for bioimage transfer learning
CytoImageNet 是一个大规模、弱监督标注的数据集,包含来自 894 个类别的 890,737 幅显微镜图像,数据源自 40 个公开数据源,旨在支持生物图像分析中的领域特定预训练。在 CytoImageNet 上进行预训练所得到的特征,若与 ImageNet 特征融合,可在下游显微镜图像分类任务中显著优于单独使用任一特征,表明二者具有互补性且与生物学相关。
Motivation: In recent years, image-based biological assays have steadily become high-throughput, sparking a need for fast automated methods to extract biologically-meaningful information from hundreds of thousands of images. Taking inspiration from the success of ImageNet, we curate CytoImageNet, a large-scale dataset of openly-sourced and weakly-labeled microscopy images (890K images, 894 classes). Pretraining on CytoImageNet yields features that are competitive to ImageNet features on downstream microscopy classification tasks. We show evidence that CytoImageNet features capture information not available in ImageNet-trained features. The dataset is made available at https://www.kaggle.com/stanleyhua/cytoimagenet.
研究动机与目标
- 为功能基因组学和药物发现中高通量显微镜图像的高效自动化分析提供支持。
- 通过创建与领域匹配的预训练数据集,克服 ImageNet 特征在捕捉显微镜图像中生物相关模式方面的局限性。
- 开发一种可扩展的框架,用于从公开可用来源整理大规模、弱监督标注的生物图像数据集。
- 证明 CytoImageNet 预训练所得到的特征与 ImageNet 特征具有互补性,可提升下游迁移学习性能。
提出的方法
- 从五个数据库(Recursion、Image Data Resource、Broad Bioimage Benchmark Collection、Kaggle 和 Cell Image Library)的 40 个公开数据集中整理出 890,737 幅显微镜图像。
- 利用元数据(如生物体、细胞类型、表型、化合物、基因、siRNA)分配弱标签,并设定每类至少 287 幅图像的阈值,以确保足够的代表性。
- 应用分层下采样以提升标签多样性,防止高频标签的过度表示。
- 通过强度归一化(第 0.1 百分位数至第 99.9 百分位数)对图像进行标准化,并探索通道合并或逐通道特征提取作为预处理方法。
- 在 CytoImageNet 上训练 EfficientNetB0 模型,并将其倒数第二层特征与 ImageNet 特征在下游分类任务中进行比较。
- 通过拼接方式融合 CytoImageNet 和 ImageNet 特征,以评估互补表征学习的效果。
实验结果
研究问题
- RQ1与 ImageNet 预训练相比,大规模弱监督标注的显微镜图像数据集是否能提升生物图像分类任务的迁移学习性能?
- RQ2从 CytoImageNet 学习到的特征是否捕捉到了 ImageNet 特征中不存在的生物信息?
- RQ3将 CytoImageNet 和 ImageNet 特征融合后,是否能在下游显微镜任务中取得优于单独使用任一特征集的性能?
- RQ4在显微镜数据上进行领域特定预训练,其性能相比通用自然图像预训练能提升多少?
- RQ5当在多样化的下游显微镜数据集上微调时,CytoImageNet 特征与 ImageNet 特征相比表现如何?
主要发现
- CytoImageNet 特征在所有下游任务中表现与 ImageNet 特征相当,分别在 BBC021 上达到 83.5% 的准确率,在 COOS7 Test Set 1 上达到 88.87%。
- 融合 CytoImageNet 和 ImageNet 特征后,性能提升至 BBC021 的 86.41%、CYCLoPs 的 77.97% 和 COOS7 Test Set 1 的 94.80%,显著优于单独使用任一特征集。
- 在 COOS7 Test Set 4 上,融合模型达到 87.47% 的准确率,而 ImageNet 和 CytoImageNet 单独使用时分别为 82.19% 和 78.52%。
- CytoImageNet 上验证准确率仅为 11.32%,表明超参数调优可能进一步提升特征质量与下游性能。
- 按通道归一化像素强度并采用逐通道特征提取,在所有数据集和特征类型中均取得最佳性能。
- 特征融合带来的显著性能增益表明,CytoImageNet 和 ImageNet 预训练学习到的表征具有显著差异且互补,与生物图像分析高度相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。