Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness study of noisy annotation in deep learning based medical image segmentation

Shaode Yu, Erlei Zhang|arXiv (Cornell University)|2020. 03. 10.
Machine Learning and Data Classification참고 문헌 14인용 수 8
한 줄 요약

이 연구는 두개부 및 경부암 환자의 CT 영상에서 노이즈가 있는 애너테이션 하에 딥 러닝 모델의 영상 분할에 대한 강건성을 조사한다. 깨끗한 턱뼈 애너테이션과 노이즈가 있는 턱뼈 애너테이션의 비율을 다양하게 조절하여 모델을 훈련시은 결과, 노이즈 수준이 20% 이하일 경우 성능 저하가 미미하게 나타나, 임상 환경에서의 애너테이션 오류에 대해 상당한 강건성을 보임을 확인하였다.

ABSTRACT

Partly due to the use of exhaustive-annotated data, deep networks have achieved impressive performance on medical image segmentation. Medical imaging data paired with noisy annotation are, however, ubiquitous, but little is known about the effect of noisy annotation on deep learning-based medical image segmentation. We studied the effects of noisy annotation in the context of mandible segmentation from CT images. First, 202 images of Head and Neck cancer patients were collected from our clinical database, where the organs-at-risk were annotated by one of 12 planning dosimetrists. The mandibles were roughly annotated as the planning avoiding structure. Then, mandible labels were checked and corrected by a physician to get clean annotations. At last, by varying the ratios of noisy labels in the training data, deep learning-based segmentation models were trained, one for each ratio. In general, a deep network trained with noisy labels had worse segmentation results than that trained with clean labels, and fewer noisy labels led to better segmentation. When using 20% or less noisy cases for training, no significant difference was found on the prediction performance between the models trained by noisy or clean. This study suggests that deep learning-based medical image segmentation is robust to noisy annotations to some extent. It also highlights the importance of labeling quality in deep learning

연구 동기 및 목표

  • 노이즈가 있는 애너테이션의 영향을 딥 러닝 기반 의료 영상 분할 성능에 미치는 영향을 평가하기 위해.
  • 노이즈가 있는 애너테이션으로 인해 모델 성능이 유의미하게 저하되기 시작하는 임계점을 정량화하기 위해.
  • 다양한 수준의 애너테이션 노이즈가 포함된 데이터로 훈련된 딥 러닝 모델의 강건성을 평가하기 위해.
  • 임상 영상에서의 실제 애너테이션 오류에 대한 딥 러닝 모델의 내성에 대한 경험적 증거를 제공하기 위해.

제안 방법

  • 임상 데이터베이스에서 두개부 및 경부암 환자의 CT 영상 202장을 수집하고, 12명의 계획 방사선 옹호사가 초기 애너테이션을 수행하였다.
  • 의사의 재평가 및 수정을 통해 기준값으로 간주되는 깨끗한 애너테이션을 확보하였다.
  • 훈련 세트 내에서 노이즈가 있는 레이블과 깨끗한 레이블의 비율을 체계적으로 변화시켰다 (0%에서 100%까지).
  • 동일한 아키텍처와 훈련 프rotocol를 사용하여 각 노이즈 비율에 맞는 딥 러닝 분할 모델을 훈련시켰다.
  • 보류된 테스트 세트에서 표준 분할 평가 지표(예: Dice 점수)를 사용하여 모델 성능을 평가하였다.
  • 다양한 노이즈 수준으로 훈련된 모델 간의 분할 성능을 비교하여 강건성을 평가하였다.

실험 결과

연구 질문

  • RQ1노이즈가 있는 애너테이션의 비율이 증가할수록 딥 러닝 모델의 분할 성능에 어떤 영향을 미치는가?
  • RQ2모델 성능이 유의미하게 저하되기 시작하는 노이즈 비율은 어느 수준인가?
  • RQ3노이즈가 있는 애너테이션의 영향을 미미하게 느끼는 임계점이 존재하는가?
  • RQ4노이즈가 있는 데이터로 훈련된 모델의 성능은 깨끗한 데이터로 훈련된 모델과 비교하여 어떻게 다른가?

주요 결과

  • 노이즈가 있는 레이블이 20% 이하인 모델은 깨끗한 레이블로 훈련된 모델과 통계적으로 유의미한 성능 차이가 없었다.
  • 훈련 레이블의 노이즈 비율이 20%를 초과할 경우에만 성능 저하가 관찰되었다.
  • 노이즈 레이블 비율이 20%를 초과할수록 점차적으로 Dice 점수가 감소하였다.
  • 이 연구는 딥 러닝 기반 의료 영상 분할 모델이 중간 수준의 애너테이션 노이즈에 대해 상당한 강건성을 보임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.