Skip to main content
QUICK REVIEW

[논문 리뷰] Classification of Cell Images Using MPEG-7-influenced Descriptors and Support Vector Machines in Cell Morphology

Tobias Abenius|ArXiv.org|2008. 12. 12.
Digital Imaging for Blood Diseases참고 문헌 8인용 수 4
한 줄 요약

이 논문은 MPEG-7 기반의 색상 및 텍스처 기술자와 서포트 벡터 머신(SVMs)을 결합하여 혈액 세포 형태 분석을 위한 세포 영상 분류 시스템을 제안한다. 표준 MPEG-7 기술자에 인간의 시각적 텍스처 특성 지표를 추가하여 개선하였으며, CellaVision™ 데이터셋의 지도 레이블 오류가 존재하는 상황에서도 주 분류 작업에서 10.8%의 오류율과 간소화된 다섯 종류의 백혈구 문제에서 3.1%의 오류율을 달성하였다.

ABSTRACT

Counting and classifying blood cells is an important diagnostic tool in medicine. Support Vector Machines are increasingly popular and efficient and could replace artificial neural network systems. Here a method to classify blood cells is proposed using SVM. A set of statistics on images are implemented in C++. The MPEG-7 descriptors Scalable Color Descriptor, Color Structure Descriptor, Color Layout Descriptor and Homogeneous Texture Descriptor are extended in size and combined with textural features corresponding to textural properties perceived visually by humans. From a set of images of human blood cells these statistics are collected. A SVM is implemented and trained to classify the cell images. The cell images come from a CellaVision DM-96 machine which classify cells from images from microscopy. The output images and classification of the CellaVision machine is taken as ground truth, a truth that is 90-95% correct. The problem is divided in two -- the primary and the simplified. The primary problem is to classify the same classes as the CellaVision machine. The simplified problem is to differ between the five most common types of white blood cells. An encouraging result is achieved in both cases -- error rates of 10.8% and 3.1% -- considering that the SVM is misled by the errors in ground truth. Conclusion is that further investigation of performance is worthwhile.

연구 동기 및 목표

  • MPEG-7 기반 기술자를 사용하는 SVM 기반의 강건한 인간 혈액 세포 영상 분류 방법을 개발하기 위해.
  • 인간 시각적 텍스처 특성으로 MPEG-7 기술자를 확장하여 분류 정확도를 향상시키기 위해.
  • 복잡한 실세계 분류 작업과 임상적으로 관련성이 높은 다섯 종류의 백혈구 문제에 대한 성능 평가를 수행하기 위해.
  • 지도 레이블 오류가 의료 영상 분류에서 SVM 성능에 미치는 영향을 평가하기 위해.
  • 딥 러닝과 대비되는 수작업으로 만든 특징이 세포 형태 분석 과제에서 경쟁력 있는 성능을 낼 수 있는지 탐색하기 위해.

제안 방법

  • 스케일러블 컬러, 컬러 구조, 컬러 레이아웃, 동질적 텍스처의 네 가지 MPEG-7 기술자를 크기를 늘리고 인간의 시각적 텍스처 특성과 조합하여 확장하였다.
  • 이웃 회색 톤 차이 행렬, 거칠기, 대비, 붐비는 정도, 복잡성, 텍스처 강도 등의 시각적 텍스처 특성을 도입하였다.
  • 빠른 푸리에 변환(FFT)을 사용하여 주파수 도메인에서 2차원 컨volution을 구현하여 가보 웨이블릿 필터링의 처리 속도를 향상시켰다.
  • 스토케스틱 그래디언트 상승의 변종을 사용하여 SVM을 훈련시키며, 다중 클래스 분류는 one-vs-all 전략을 적용하였다.
  • SVM 수렴 및 일반화 성능 향상을 위해 데이터 스케일링과 특징 정규화를 적용하였다.
  • 사용자 정의 파이프라인(jpeg_genfeature)을 통해 특징을 생성하고, 모델 훈련 및 예측을 위해 libSVM 형식으로 저장하였다.

실험 결과

연구 질문

  • RQ1MPEG-7 기반 기술자에 인간의 시각적 텍스처 특성을 추가하면 혈액 세포 형태 분류 정확도가 향상되는가?
  • RQ2자신의 (잠재적으로 노이즈가 있는) 지도 레이블로 훈련된 SVM 기반 시스템의 성능이 CellaVision™ DM-96 기계와 비교해 어떻게 되는가?
  • RQ3지도 레이블 데이터의 오류가 훈련된 SVM 모델의 일반화 능력과 오류율에 어느 정도 영향을 미치는가?
  • RQ4간소화된 다섯 종류의 백혈구 분류 작업은 임상적 관련성과 모델 평가에 얼마나 효과적인가?
  • RQ5수작업으로 만든, 딥 러닝이 아닌 특징은 최신 기술 대비 경쟁력 있는 성능을 낼 수 있는가?

주요 결과

  • 주 분류 작업에서 시스템은 10.8%의 오류율을 기록하였으며, 이는 CellaVision™ DM-96 기계가 구분하는 동일한 클래스를 식별하는 데에 해당한다.
  • 가장 흔한 백혈구 유형에 집중한 간소화된 다섯 종류의 문제에서는 오류율이 3.1%로 유의미하게 낮아졌다.
  • 주 문제에서 가장 흔한 오분류는 분절된 호중구(클래스 1)와 띠형 호중구(클래스 6) 사이에서 발생하였으며, 이들은 외관상 유사하여 지도 레이블에서도 자주 잘못 분류된다.
  • 간소화된 문제에서 오분류가 가장 높았던 조합은 단핵구(클래스 5)와 리모프티드 세포(클래스 31) 사이였으며, 이들은 전문가조차도 쉽게 구분하기 어려운 유형이었고 CellaVision™ 시스템 역시 어려움을 겪었다.
  • 저자들은 모델 성능이 지도 레이블 오류로 인해 제한되어 있음을 결론 내렸으며, 이상적인 레이블이 존재한다면 성능 향상이 상당히 가능할 것으로 보인다.
  • 특징 공학 및 모델 최적화의 추가 연구가 가치가 있음을 시사하며, 특히 간소화된 작업에서의 뛰어난 성능을 고려할 때 그러한 연구가 유의미하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.