Skip to main content
QUICK REVIEW

[논문 리뷰] ERS: a novel comprehensive endoscopy image dataset for machine learning, compliant with the MST 3.0 specification

Jan Cychnerski, Tomasz Dziubich|arXiv (Cornell University)|2022. 01. 21.
Colorectal Cancer Screening and Detection인용 수 4
한 줄 요약

이 논문은 유연성 내 endoscopy와 캡슐 내 endoscopy에서 유래한 약 115,000개의 근사 레이블이 부여된 프레임과 123만 개의 레이블이 부여되지 않은 프레임을 포함한 대규모 다중 레이블 endoscopy 이미지 데이터셋인 ERS를 소개한다. 이 데이터셋은 MST 3.0 용어 기준에 완전히 부합하며, 딥 러닝 모델의 고성능 훈련을 가능하게 하며, 이중 분류에서 최대 94%의 F-스코어를 달성하고, 정상 프레임을 필터링하기 위해 MobileNet 기반 분류기를 사용할 경우 영상 길이를 최대 80%까지 단축시켜 임상 검토 속도를 향상시킨다.

ABSTRACT

The article presents a new multi-label comprehensive image dataset from flexible endoscopy, colonoscopy and capsule endoscopy, named ERS. The collection has been labeled according to the full medical specification of 'Minimum Standard Terminology 3.0' (MST 3.0), describing all possible findings in the gastrointestinal tract (104 possible labels), extended with an additional 19 labels useful in common machine learning applications. The dataset contains around 6000 precisely and 115,000 approximately labeled frames from endoscopy videos, 3600 precise and 22,600 approximate segmentation masks, and 1.23 million unlabeled frames from flexible and capsule endoscopy videos. The labeled data cover almost entirely the MST 3.0 standard. The data came from 1520 videos of 1135 patients. Additionally, this paper proposes and describes four exemplary experiments in gastrointestinal image classification task performed using the created dataset. The obtained results indicate the high usefulness and flexibility of the dataset in training and testing machine learning algorithms in the field of endoscopic data analysis.

연구 동기 및 목표

  • 기존에 공개된 바 없는 표준화되고 종합적인 내시경 데이터셋이 위장관 진단 분야의 머신러닝에 부족한 문제를 해결하기 위해.
  • 위장관 이상 소견에 걸쳐 일관된 레이블링을 가능하게 하기 위해 최소 기준 용어 3.0(MST 3.0)에 준수하는 대규모 다중 레이블 데이터셋을 구축하기 위해.
  • 대장내시경 및 캡슐 내시경에서 폴립, 출혈 및 기타 위장관 기관 이상 소견의 자동 탐지를 위한 머신러닝 모델 개발 및 벤치마킹을 지원하기 위해.
  • ERS 데이터셋을 사용하여 다중 클래스 및 이중 분류 과제에서 딥 러닝 모델의 성능을 평가하고, 실제 임상 적용 가능성을 중점적으로 다루기 위해.
  • 정상 프레임을 자동으로 필터링하는 알고리즘을 통해 영상 검토 시간을 현저히 단축시킴으로써 데이터셋의 실용적 영향을 입증하기 위해.

제안 방법

  • ERS 데이터셋은 1,135명의 환자로부터 확보한 1,520개의 내시경 영상으로 구성되어 있으며, 유연성 대장내시경, 위내시경 및 무선 캡슐 내시경 영상이 포함되어 있으며, 정확한 레이블이 부여된 6,000개의 프레임과 근사 레이블이 부여된 115,000개의 프레임을 포함한다.
  • 모든 이미지에 대해 104개의 레이블을 포함한 MST 3.0 용어 체계를 전부 사용하였으며, 머신러닝 응용에 관련된 19개의 추가 레이블을 추가하였다.
  • 병변 국소화를 지원하기 위해 정확한 3,600개 및 근사한 22,600개의 세그멘테이션 마스크가 포함되어 있으며, 분류 및 세그멘테이션 과제 모두를 지원한다.
  • 다양한 분류 복잡도(2-클래스, 5-클래스, 10-클래스)에 대해 컨volutional 네트워크(CNN)를 사용한 네 가지 벤치마크 실험을 수행하였으며, MobileNet, NASNet-Mobile 등을 포함한 다양한 모델을 활용하였다.
  • 정상 프레임을 제거하기 위해 훈련된 MobileNet 기반의 영상 필터링 알고리즘을 적용하였으며, 탐지 정확도와 영상 길이 단축 간 균형을 맞추기 위해 민감도 및 특이도 파rameter를 조정하였다.
  • 성능 평가에는 F-스코어를 사용하였으며, 클래스 불균형 문제를 해결하기 위해 환자 수준의 이미지 수 균형 조정을 실시하였지만, 이는 모델 성능에 미미한 영향을 미쳤다.

실험 결과

연구 질문

  • RQ1MST 3.0에 준수하는 대규모 표준화된 종합적인 내시경 데이터셋이 위장관 진단 분야의 머신러닝 모델 성능 향상과 재현 가능성 향상에 기여할 수 있는가?
  • RQ2다양한 분류 복잡도(2-클래스, 5-클래스, 10-클래스)에서 다양한 딥 러닝 아키텍처(MobileNet, NASNet-Mobile 등)가 ERS 데이터셋에서 어떻게 성능을 내는가?
  • RQ3학습된 분류기를 사용한 정상 프레임 자동 필터링이 캡슐 내시경 영상의 임상 검토에 소요되는 시간을 어느 정도 단축시킬 수 있는가?
  • RQ4정확한 레이블과 근사 레이블의 존재가 병변 탐지 과제에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5데이터 불균형과 환자 수준의 데이터 분포가 다중 클래스 분류에서 모델 일반화 능력과 F-스코어에 어떤 영향을 미치는가?

주요 결과

  • ERS 데이터셋은 115,000개의 근사 레이블이 부여된 프레임과 123만 개의 레이블이 부여되지 않은 프레임을 포함하며, 거의 모든 MST 3.0 용어 기준 카테고리가 포함되어 있다.
  • 10-클래스 분류 과제에서 정상 조직, 뿌연 이미지, 정맥류 소견에 대해 F-스코어가 86–90%를 기록하였고, 대부분의 질환에 대해 75–78%를 기록하였으며, 희귀 질환인 크론병의 경우 훈련 데이터 수가 제한되어(84장) F-스코어가 38%로 낮게 나타났다.
  • 5-클래스 문제에서는 질환에 대해 F-스코어가 80–85%로 나타났고, 건강한 조직에 대해서는 92%를 기록하였으며, 클래스 복잡도 감소와 저자원 클래스의 부재로 인해 10-클래스 설정보다 뛰어난 성능을 보였다.
  • 2-클래스 문제(비정상 대비 건강한 조직)에서는 F-스코어가 88%를 기록하였으며, MobileNet이 가장 높은 성능을 보였고, 정확도가 떨어지는 레이블도 결과에 약간 향상 효과를 보였다.
  • BLUR 탐지 과제에서는 F-스코어가 94%로 가장 높게 나타나 이 특정 분류 과제에서 강력한 모델 성능을 입증하였다.
  • 훈련된 MobileNet 분류기를 WCE 영상에 적용한 결과, 민감도 99%에서 영상 길이가 16% 단축되었고, 민감도 기준을 낮추면 80% 이상 단축되어 임상 검토 속도가 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.