[논문 리뷰] Pressure Ulcer Categorisation using Deep Learning: A Clinical Trial to Evaluate Model Performance
이 연구는 실생활 NHS 임상 시험에서 스마트폰 이미지로부터 압력성 궤양(Ⅰ–Ⅳ, DTI, 단계 결정 불가)을 자동으로 분류하기 위해 Faster R-CNN 기반의 딥러닝 기반 모바일 시스템을 평가한다. 216장의 검증된 이미지로 모델은 0.75 신뢰도 임계값에서 평균 F1 스코어 0.6786을 기록하였으며, 표준화된 보고서 작성에 있어 임상적으로 충분하지는 않지만 유망한 성능을 보였다.
Pressure ulcers are a challenge for patients and healthcare professionals. In the UK, 700,000 people are affected by pressure ulcers each year. Treating them costs the National Health Service {\\pounds}3.8 million every day. Their etiology is complex and multifactorial. However, evidence has shown a strong link between old age, disease-related sedentary lifestyles and unhealthy eating habits. Pressure ulcers are caused by direct skin contact with a bed or chair without frequent position changes. Urinary and faecal incontinence, diabetes, and injuries that restrict body position and nutrition are also known risk factors. Guidelines and treatments exist but their implementation and success vary across different healthcare settings. This is primarily because healthcare practitioners have a) minimal experience in dealing with pressure ulcers, and b) a general lack of understanding of pressure ulcer treatments. Poorly managed, pressure ulcers lead to severe pain, poor quality of life, and significant healthcare costs. In this paper, we report the findings of a clinical trial conducted by Mersey Care NHS Foundation Trust that evaluated the performance of a faster region-based convolutional neural network and mobile platform that categorised and documented pressure ulcers. The neural network classifies category I, II, III, and IV pressure ulcers, deep tissue injuries, and unstageable pressure ulcers. Photographs of pressure ulcers taken by district nurses are transmitted over 4/5G communications to an inferencing server for classification. Classified images are stored and reviewed to assess the model's predictions and relevance as a tool for clinical decision making and standardised reporting. The results from the study generated a mean average Precision=0.6796, Recall=0.6997, F1-Score=0.6786 with 45 false positives using an @.75 confidence score threshold.
연구 동기 및 목표
- 지역 간호사들이 수행하는 압력성 궤양의 임상적 변동성과 일관되지 않은 분류 문제를 해결하기 위해.
- 딥러닝을 활용한 AI 기반 모바일 시스템을 개발하고 평가하여, 실시간 임상 의사결정 지원을 위한 압력성 궤양 분류의 표준화를 도모하기 위해.
- 기초의료 환경에서 실제 생활의 저품질 임상 영상으로 훈련된 Faster R-CNN 모델의 타당성과 성능을 평가하기 위해.
- 이미지 품질과 클래스 불균형과 같은 모델 성능 저하 요인을 식별하고未래 향상에 대비한 해결책을 제안하기 위해.
- 압력성 궤양 이미지의 개방형 공유와 표준화된 촬영 프로토콜을 통해 AI 모델 정확도 향상을 위한 권고를 내기 위해.
제안 방법
- 압력성 궤양을 Ⅰ, Ⅱ, Ⅲ, Ⅳ, 심부조직손상(DTI), 단계 결정 불가의 여섯 가지 범주로 분류하기 위해 Faster Region-based Convolutional Neural Network(Faster R-CNN)을 훈련시켰다.
- 지역 간호사들이 모바일 기기로 압력성 궤양 영상을 촬영하고 4G/5G를 통해 리버풀 존 무어스 대학교의 서버로 전송하여 추론을 수행하였다.
- 환경적 변동성을 줄이기 위해 상처에 집중할 수 있도록 영상 전처리 과정에서 자르기(cropping)를 수행하여 모델 성능을 향상시켰다.
- 사전 훈련된 백본을 사용한 전이학습을 적용하였으며, 8개월 간 수집된 총 1,016장의 이미지 데이터셋을 기반으로 훈련을 수행하였고, 품질 필터링 후 216장으로 감소시켰다.
- 표준 객체 검출 평가 지표인 평균 평균 정밀도(mAP), 평균 재현율(mAR), 평균 F1 스코어(mAF1)를 사용하여 성능을 평가하였다.
- 정밀도와 재현율의 균형을 맞추기 위해 0.75의 신뢰도 임계값을 적용하였으며, 임상적 관련성이 있는 가짜 양성 결과를 분석하였다.
실험 결과
연구 질문
- RQ1실생활 저품질 스마트폰 영상으로 압력성 궤양을 다수의 단계와 유형으로 정확하게 분류할 수 있는 딥러닝 모델은 지역 의료 환경에서 가능한가?
- RQ2이미지 자르기 및 전처리 조치는 Faster R-CNN 모델의 압력성 궤양 분류 성능에 어떤 영향을 미치는가?
- RQ3현재 모델의 성능가 임상적 기준을 충족하여 일상 환자 간호 및 보고서 작성에 활용 가능한가?
- RQ4압력성 궤양 분류 모델을 위한 충분하고 고품질이며 균형 잡힌 훈련 데이터 확보에 직면한 주요 과제는 무엇인가?
- RQ5표준화된 촬영 프로토콜과 데이터 공유를 통해 향후 모델 성능 향상과 임상적 도입이 어떻게 향상될 수 있는가?
주요 결과
- 0.75의 신뢰도 임계값에서 모델은 평균 F1 스코어 0.6786, 정밀도 0.6796, 재현율 0.6997을 기록하여 중간 정도이지만 아직 임상적으로 충분하지 않은 성능을 보였다.
- 이미지 자르기 조치가 모델 성능을 크게 향상시켜 mAP를 0.3639에서 0.6796으로 상승시켰으며, 상처에 집중하는 것이 중요함을 입증하였다.
- 시스템은 총 45건의 가짜 양성 결과를 생성하여, 궤양과 유사한 피부 상태나 잡음 요소를 구분하는 데 향후 개선 여지가 있음을 시사하였다.
- 낮은 품질의 인터넷 이미지로 훈련을 수행했음에도 불구하고 합리적인 결과를 도출하였으며, 향후 고품질 데이터로의 개선 가능성을 시사하였다.
- 이 연구는 성능가 90프로(percentile)에 도달하기 위해 최소 9,000장의 고품질이고 균형 잡힌 이미지(각 범주별 1,500장)가 필요하다고 밝혔으며, 이는 이 시험에서 충족되지 않았다.
- 결과는 표준화된 촬영 방식과 개방형 데이터 공유가 압력성 궤양 관리 분야에서 AI 발전을 이끄는 데 중요하다는 점을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.