Skip to main content
QUICK REVIEW

[논문 리뷰] On the in vivo recognition of kidney stones using machine learning

Lopez-Tiro, Francisco, V. Estrade|arXiv (Cornell University)|2022. 01. 21.
Kidney Stones and Urolithiasis Treatments인용 수 9
한 줄 요약

이 연구는 비제어적인 영상 조건에서 내시경 영상 데이터를 활용해 신장결석을 내시경 검사 중 실시간으로 분류하기 위한 실시간 기계학습 기반 접근법을 제안한다. 얕은 학습 방법과 딥러닝 아키텍처를 비교 분석한 결과, Inception v3 모델이 가장 높은 성능을 보였으며, 가중 F1 스코어는 0.97을 기록하였다. 반면, 최적화된 색상 및 텍스처 특징을 사용한 XGBoost는 F1 스코어 0.96을 달성하여, 제어되지 않은 임상 환경에서도 수작업으로 설계된 특징이 딥러닝 성능을 뛰어넘을 수 있음을 보여주었다.

ABSTRACT

Determining the type of kidney stones allows urologists to prescribe a treatment to avoid recurrence of renal lithiasis. An automated in-vivo image-based classification method would be an important step towards an immediate identification of the kidney stone type required as a first phase of the diagnosis. In the literature it was shown on ex-vivo data (i.e., in very controlled scene and image acquisition conditions) that an automated kidney stone classification is indeed feasible. This pilot study compares the kidney stone recognition performances of six shallow machine learning methods and three deep-learning architectures which were tested with in-vivo images of the four most frequent urinary calculi types acquired with an endoscope during standard ureteroscopies. This contribution details the database construction and the design of the tested kidney stones classifiers. Even if the best results were obtained by the Inception v3 architecture (weighted precision, recall and F1-score of 0.97, 0.98 and 0.97, respectively), it is also shown that choosing an appropriate colour space and texture features allows a shallow machine learning method to approach closely the performances of the most promising deep-learning methods (the XGBoost classifier led to weighted precision, recall and F1-score values of 0.96). This paper is the first one that explores the most discriminant features to be extracted from images acquired during ureteroscopies.

연구 동기 및 목표

  • 내시경 영상 데이터를 활용해 실시간으로 신장결석을 분류할 수 있는 기계학습 모델을 개발하고 평가하는 것.
  • 비제어적인 임상 환경에서 촬영된 내시경 영상에 대해 얕은 기계학습 방법과 딥러닝 아키텍처의 성능을 비교하는 것.
  • 딥 네트워크에 의존하지 않고도 분류 정확도를 향상시킬 수 있는 최적의 특징 공간(예: 색상, 텍스처)을 규명하는 것.
  • 세균성 결석의 네 가지 주요 유형(웨헬라이트, 웨드엘라이트, 요산 일수화물, 스트루비트)을 포함하는 임상적으로 유의미한 내시경 영상 데이터베이스를 구축하는 것.
  • 우리 요로과에서 재발률을 낮추고 개인 맞춤 치료를 지원하기 위해 신장결석 유형 자동 인식의 가능성을 평가하는 것.

제안 방법

  • 신장결석의 내시경 영상 1,058장을 수집하였으며, 주로 네 가지 유형으로 나뉘어졌다: 유형 I(웨헬라이트), 유형 II(웨드엘라이트), 유형 IIIb(요산 일수화물), 유형 IVc(스트루비트).
  • RGB, HSV, HSI 등의 다양한 색상 공간을 사용하여 영상 전처리를 수행하고, 국소 이진 패턴(LBP) 및 회색 수준 공존 행렬(GLCM)을 활용해 텍스처 특징을 추출하였다.
  • 다중 클래스 분류를 위해 여섯 종류의 얕은 학습 모델(XGBoost, 랜덤 포레스트, SVM 등)과 세 종류의 딥러닝 모델(Inception v3, ResNet-101, DenseNet-121)을 학습하였다.
  • 모든 클래스에서 가중 평균 정밀도, 재현율, F1 스코어를 사용해 모델 성능을 평가하였으며, 특징 공간의 군집화 및 모델 행동을 해석하기 위해 UMAP 시각화를 통합하였다.
  • UMAP 시각화 결과를 기반으로 상호작용 가능한 도구(Iva)를 개발하여 혼합 및 순수한 결석 유형 간의 분류 가능성을 탐색하였다.
  • 교차 검증을 통해 하이퍼파라미터를 최적화하고, 표면, 단면, 혼합 표면/단면 영상 유형에 대한 일반화 능력을 평가하였다.

실험 결과

연구 질문

  • RQ1비제어적인 촬영 조건에서 실시간 내시경 영상에 대해 얕은 기계학습 모델이 높은 분류 정확도를 달성할 수 있는가?
  • RQ2실제 임상 환경에서 내시경 영상로 촬영된 결석 유형을 분류할 때, 딥러닝 모델과 얕은 기계학습 모델 간의 성능 차이는 어떻게 되는가?
  • RQ3어느 색상 공간과 텍스처 특징이 결석 인식 성능 향상에 가장 기여하는가?
  • RQ4형태학적으로 유사한 결석 유형(예: 웨드엘라이트 vs. 요산, 웨헬라이트 vs. 웨드엘라이트)을 임상 영상에서 구분하는 데 주요 과제는 무엇인가?
  • RQ5실제 내시경 영상에서 표면, 단면, 혼합 영상 유형에 따라 모델 성능과 클래스 간 분리 가능성은 어떻게 변화하는가?

주요 결과

  • Inception v3 딥러닝 모델이 가장 높은 성능을 보였으며, 모든 네 가지 결석 유형에서 가중 F1 스코어 0.97, 정밀도 0.97, 재현율 0.98을 기록하였다.
  • 최적화된 색상 및 텍스처 특징을 사용한 XGBoost 분류기는 가중 F1 스코어 0.96을 달성하여, 얕은 학습 모델이 딥러닝 성능에 근접할 수 있음을 입증하였다.
  • 웨드엘라이트(유형 II)와 브러시트(유형 IVd)의 경우 성능이 가장 낮았으며, 재현율이 낮아 형태학적 유사성이 분류 어려움을 초래함을 시사하였다.
  • 요산 일수화물(유형 IIIb)은 모든 모델에서 가장 일관되게 높은 정밀도와 재현율을 기록하여 가장 잘 분류된 유형이었다.
  • UMAP 시각화 결과, 요산 일수화물의 클래스 분리도가 가장 높고, 웨드엘라이트와 브러시트의 경우 가장 낮은 것으로 확인되어 정량적 성능 지표와 일치하였다.
  • HSV 및 HSI 색상 공간의 사용은 모델의 강인성을 향상시키고 대규모 딥 네트워크의 필요성을 줄였으며, 임상 현장에서의 빠른 추론 가능성을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.