Skip to main content
QUICK REVIEW

[논문 리뷰] A Curated and Re-annotated Peripheral Blood Cell Dataset Integrating Four Public Resources

Lu Gan, Xi Li|arXiv (Cornell University)|2024. 07. 18.
Single-cell and spatial transcriptomicsBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 BCCD, BCD, PBC, 그리고 Raabin-WBC 데이터셋을 철저한 샘플 삭제, YOLOv8n를 활용한 반자동 레이블링, 수동 검토를 거친 후 통합하여 고품질의 재라벨링된 혈액세포 데이터셋인 TXL-PBC를 소개한다. 결과적으로 생성된 데이터셋은 훈련용 1008장, 검증용 288장, 테스트용 144장으로 구성되며, 레이블 분포와 검출 성능 면에서 뛰어난 성능을 보이며, YOLOv8n는 전체 데이터셋에서 0.964 mAP를 기록하여 원본 데이터셋보다 유의하게 뛰어난 성능을 보였다.

ABSTRACT

We present TXL-PBC, a curated and re-annotated peripheral blood cell dataset constructed by integrating four publicly available resources: Blood Cell Count and Detection (BCCD), Blood Cell Detection Dataset (BCDD), Peripheral Blood Cells (PBC), and Raabin White Blood Cell (Raabin-WBC). Through rigorous sample selection, semi-automatic annotation using the YOLOv8n model, and comprehensive manual review, we ensured high annotation accuracy and consistency. The final dataset contains 1,260 images and 18,143 bounding box annotations for three major blood cell types: white blood cells (WBC), red blood cells (RBC), and platelets. We provide detailed visual analyses of the data distribution, demonstrating the diversity and balance of the dataset. To further validate the quality and utility of TXL-PBC, we trained several mainstream object detection models, including YOLOv5s, YOLOv8s, YOLOv11s, SSD300, Faster R-CNN, and RetinaNet, and report their baseline performance. The TXL-PBC dataset is openly available on Figshare and GitHub, offering a valuable resource for the development and benchmarking of blood cell detection models and related machine learning research.

연구 동기 및 목표

  • 공개된 혈액세포 데이터셋의 핵심적 결함, 즉 레이블 오류, 부족한 샘플 수, 열악한 데이터 품질 문제를 해결하기 위해.
  • BCCD, BCD, PBC, Raabin-WBC의 네 가지 공개 자원을 통합하고 재라벨링하여 고품질의 샘플 수가 균형 잡힌 데이터셋을 구축하기 위해.
  • 향상된 데이터 품질과 일관성으로 AI 모델의 신뢰성과 일반화 능력을 향상시키기 위해.
  • 미래 연구를 위해 표준화된 분할과 포괄적인 레이블을 갖춘 기준 데이터셋을 구축하기 위해.
  • YOLOv5 및 YOLOv8 아키텍처를 사용한 검출 작업을 위한 공개 가능하고 고성능의 기준 모델을 제공하기 위해.

제안 방법

  • BCCD 및 BCD 데이터셋에서 저품질 샘플을 수동으로 삭제하여 데이터 무결성을 향상시켰다.
  • 모든 데이터셋에 대해 YOLOv8n를 활용한 반자동 레이블링을 수행한 후, 레이블 정확도를 확보하기 위해 수동 검토를 실시하였다.
  • BCCD, BCD, PBC, Raabin-WBC에서 청소 및 재라벨링된 데이터를 통합하여 무작위로 섞고 이름을 변경하여 다양성을 확보한 통합 데이터셋을 구축하였다.
  • 최종 데이터셋을 1008장의 훈련, 288장의 검증, 144장의 테스트 이미지로 분할하여 균형 잡힌 평가를 확보하였다.
  • TXL-PBC에서 여러 YOLO 기반 모델(YOLOv5n/s/l, YOLOv8s/m)을 훈련시켜 성능 기준선을 수립하였다.
  • BCCD, BCD, TXL-PBC 간의 레이블 분포, 경계 상자 면적, 검출 mAP를 비교 분석하여 향상된 성능를 검증하였다.

실험 결과

연구 질문

  • RQ1공개된 혈액세포 데이터셋의 재라벨링과 통합이 검출 모델 성능을 유의미하게 향상시키는가?
  • RQ2TXL-PBC의 레이블 분포와 경계 상자 면적 분포는 BCCD 및 BCD와 비교해 어떻게 다른가?
  • RQ3TXL-PBC는 혈액세포 분석에서 새로운 객체 검출 모델의 훈련 및 평가를 위한 신뢰할 수 있는 기준 데이터셋으로 활용될 수 있는가?
  • RQ4다양한 YOLO 아키텍처가 TXL-PBC 데이터셋에서 원본 데이터셋과 비교해 얼마나 우수한 성능을 보이는가?
  • RQ5여러 데이터셋의 통합이 모델의 일반화 능력을 향상시키고 레이블 오류를 줄이는 데 기여하는가?

주요 결과

  • TXL-PBC는 BCCD 및 BCD와 비교해 레이블 경계 상자 면적의 분포가 훨씬 넓고, 더 많은 레이블을 포함하고 있어 데이터 다양성과 커버리지가 향상됨을 나타낸다.
  • TXL-PBC에서 훈련된 YOLOv8n 모델은 전체 검출 작업에서 평균 정밀도(mAP) 0.964를 기록하여 BCCD 및 BCD 데이터셋에서의 성능을 모두 초월하였다.
  • YOLOv8m는 모든 클래스에서 최고의 mAP 0.964를 기록했으며, 적혈구(RBCs)는 0.960, 백혈구(WBCs)는 0.978, 혈소판(platelets)은 0.925를 기록하여 강력한 일반화 능력을 보였다.
  • YOLOv5n, YOLOv5s, YOLOv5l, YOLOv8s, YOLOv8m는 모두 원본 BCCD 및 BCD 데이터셋에서 훈련한 경우보다 TXL-PBC에서 더 높은 mAP 점수를 기록하였다.
  • 데이터셋의 향상된 레이블 일관성과 감소된 잘못된 레이블링은 모델 훈련 오차를 크게 줄였고 검출 신뢰도를 향상시켰다.
  • TXL-PBC 데이터셋은 https://github.com/lugan113/TXL-PBC_Dataset 에서 공개되어 있어 재현 가능한 연구와 모델 기준 테스트를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.