Skip to main content
QUICK REVIEW

[论文解读] A Curated and Re-annotated Peripheral Blood Cell Dataset Integrating Four Public Resources

Lu Gan, Xi Li|arXiv (Cornell University)|Jul 18, 2024
Single-cell and spatial transcriptomicsBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

本论文提出了TXL-PBC,一个高质量、重新标注的外周血细胞数据集,整合了BCCD、BCD、PBC和Raabin-WBC数据集,在经过严格样本删除、使用YOLOv8n进行半自动标注并经人工审核后形成。该数据集包含1008张训练图像、288张验证图像和144张测试图像,展现出更优的标签分布与检测性能,YOLOv8n在完整数据集上的mAP达到0.964,显著优于原始数据集。

ABSTRACT

We present TXL-PBC, a curated and re-annotated peripheral blood cell dataset constructed by integrating four publicly available resources: Blood Cell Count and Detection (BCCD), Blood Cell Detection Dataset (BCDD), Peripheral Blood Cells (PBC), and Raabin White Blood Cell (Raabin-WBC). Through rigorous sample selection, semi-automatic annotation using the YOLOv8n model, and comprehensive manual review, we ensured high annotation accuracy and consistency. The final dataset contains 1,260 images and 18,143 bounding box annotations for three major blood cell types: white blood cells (WBC), red blood cells (RBC), and platelets. We provide detailed visual analyses of the data distribution, demonstrating the diversity and balance of the dataset. To further validate the quality and utility of TXL-PBC, we trained several mainstream object detection models, including YOLOv5s, YOLOv8s, YOLOv11s, SSD300, Faster R-CNN, and RetinaNet, and report their baseline performance. The TXL-PBC dataset is openly available on Figshare and GitHub, offering a valuable resource for the development and benchmarking of blood cell detection models and related machine learning research.

研究动机与目标

  • 解决公开血细胞数据集中存在的关键缺陷,包括标注错误、样本数量不足和数据质量差等问题。
  • 通过整合并重新标注四个公开资源(BCCD、BCD、PBC和Raabin-WBC),创建一个高质量、样本均衡的数据集。
  • 通过提升数据质量和一致性,增强AI模型在血细胞检测任务中的可靠性与泛化能力。
  • 建立一个具有标准化划分和全面标注的基准数据集,以支持未来研究。
  • 为使用YOLOv5和YOLOv8架构的检测任务提供免费获取、高性能的基线模型。

提出的方法

  • 对BCCD和BCD数据集中的低质量样本进行人工删除,以提升数据完整性。
  • 对所有数据集使用YOLOv8n进行半自动标注,随后进行人工审核以确保标注准确性。
  • 将BCCD、BCD、PBC和Raabin-WBC清洗并重新标注后的数据整合为统一数据集,通过随机打乱和重命名提升多样性。
  • 将最终数据集划分为1008张训练图像、288张验证图像和144张测试图像,以确保评估的平衡性。
  • 在TXL-PBC上训练多种基于YOLO的模型(YOLOv5n/s/l、YOLOv8s/m),以建立性能基线。
  • 对BCCD、BCD和TXL-PBC在标签分布、边界框面积分布及检测mAP方面进行对比分析,以验证改进效果。

实验结果

研究问题

  • RQ1对公开血细胞数据集进行重新标注与整合,是否能显著提升检测模型的性能?
  • RQ2TXL-PBC中的标签分布与边界框面积分布与BCCD和BCD相比有何差异?
  • RQ3TXL-PBC能否作为训练和评估新型目标检测模型在血细胞分析中性能的可靠基准?
  • RQ4不同YOLO架构在TXL-PBC数据集上的表现与在原始数据集上的表现相比,差异程度如何?
  • RQ5整合多个数据集在多大程度上能提升模型的泛化能力并减少标注偏差?

主要发现

  • 与BCCD和BCD相比,TXL-PBC展现出更宽泛的标签边界框面积分布和更多的标签数量,表明数据多样性与覆盖范围得到显著提升。
  • 在TXL-PBC上训练的YOLOv8n模型在完整检测任务中达到0.964的平均精度均值(mAP),优于在BCCD和BCD数据集上的表现。
  • YOLOv8m在所有类别中均达到最高mAP(0.964),其中红细胞(RBCs)为0.960,白细胞(WBCs)为0.978,血小板(platelets)为0.925,展现出强大的泛化能力。
  • YOLOv5n、YOLOv5s、YOLOv5l、YOLOv8s和YOLOv8m在TXL-PBC上的mAP均优于在原始BCCD和BCD数据集上训练的结果。
  • 数据集改进后的标签一致性与减少的误标显著降低了模型训练误差,提升了检测可靠性。
  • TXL-PBC数据集已公开发布于https://github.com/lugan113/TXL-PBC_Dataset,支持可复现的研究与模型基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。