[논문 리뷰] Performance Deterioration of Deep Learning Models after Clinical Deployment: A Case Study with Auto-segmentation for Definitive Prostate Cancer Radiotherapy
이 연구는 전립선암 방사선 치료에서 임상 현장에 도입된 딥러닝 기반 자동 세분화 모델의 성능 저하를 조사한다. 2006~2011년 데이터로 훈련한 UNet 모델을 2012~2022년 1,328명의 환자 데이터로 테스트한 결과, 2015년 이후 전립선 및 직장의 윤곽선에 대한 DSC가 유의하게 감소하는 것으로 나타났으며, 이는 하이드로젤 스플리터, 슬라이스 두께, 정맥 주입 대조제 사용 등의 임상 관행 변화가 원인임을 규명하였다. 이는 지속적인 모델 모니터링과 적응이 필요함을 시사한다.
We evaluated the temporal performance of a deep learning (DL) based artificial intelligence (AI) model for auto segmentation in prostate radiotherapy, seeking to correlate its efficacy with changes in clinical landscapes. Our study involved 1328 prostate cancer patients who underwent definitive radiotherapy from January 2006 to August 2022 at the University of Texas Southwestern Medical Center. We trained a UNet based segmentation model on data from 2006 to 2011 and tested it on data from 2012 to 2022 to simulate real world clinical deployment. We measured the model performance using the Dice similarity coefficient (DSC), visualized the trends in contour quality using exponentially weighted moving average (EMA) curves. Additionally, we performed Wilcoxon Rank Sum Test to analyze the differences in DSC distributions across distinct periods, and multiple linear regression to investigate the impact of various clinical factors. The model exhibited peak performance in the initial phase (from 2012 to 2014) for segmenting the prostate, rectum, and bladder. However, we observed a notable decline in performance for the prostate and rectum after 2015, while bladder contour quality remained stable. Key factors that impacted the prostate contour quality included physician contouring styles, the use of various hydrogel spacer, CT scan slice thickness, MRI-guided contouring, and using intravenous (IV) contrast. Rectum contour quality was influenced by factors such as slice thickness, physician contouring styles, and the use of various hydrogel spacers. The bladder contour quality was primarily affected by using IV contrast. This study highlights the challenges in maintaining AI model performance consistency in a dynamic clinical setting. It underscores the need for continuous monitoring and updating of AI models to ensure their ongoing effectiveness and relevance in patient care.
연구 동기 및 목표
- 임상 도입 후 전립선암 방사선 치료에서 딥러닝 자동 세분화 모델의 장기적 성능 안정성을 평가하기 위해.
- 시간이 지남에 따라 AI 기반 윤곽선 설정의 성능 저하에 기여하는 임상적 및 영상적 요인을 규명하기 위해.
- 16년간의 기간 동안 전립선, 직장, 방광 구조물에 대한 DSC의 시간적 변화를 평가하기 위해.
- 하이드로젤 스플리터, 슬라이스 두께, 정맥 주입 대조제 사용 등의 변화하는 임상 관행이 모델 성능에 미치는 영향을 조사하기 위해.
- 동적인 임상 환경에서 AI의 유효성을 유지하기 위해 지속적인 모델 모니터링 및 재훈련 프로토콜을 제안하기 위해.
제안 방법
- 2006년부터 2011년까지의 1,328명의 전립선암 환자 영상에서 훈련된 UNet 기반 딥러닝 모델을 사용하여 전립선, 직장, 방광의 자동 세분화를 수행하였다.
- 모델 성능은 2012년부터 2022년까지의 테스트 데이터를 사용하여 주로 DSC를 평가 기준으로 삼았다.
- 시간 경과에 따른 윤곽 품질 추세를 시각화하기 위해 지수 이동 평균(EMA) 곡선을 사용하였다.
- 다른 시간 간격 간의 DSC 분포에 유의미한 차이가 있는지 확인하기 위해 윌코크슨 순위합 검정을 적용하였다.
- 슬라이스 두께, 하이드로젤 사용, 정맥 주입 대조제, 의사의 윤곽선 설정 스타일 등의 임상 요인이 DSC 값에 미치는 영향을 정량화하기 위해 다중 선형 회귀 분석을 사용하였다.
- 임상 환경의 변화를 반영하기 위해 초기 데이터로 훈련하고 점차 후행 시기의 데이터로 테스트하는 방식으로 실제 현장 도입을 시뮬레이션하였다.
실험 결과
연구 질문
- RQ1임상 도입 후 전립선암 방사선 치료에서 딥러닝 자동 세분화 모델의 성능은 시간이 지남에 따라 어떻게 변화하는가?
- RQ2AI 기반 윤곽선 설정에서 성능 저하와 가장 강하게 연관된 임상 요인은 무엇인가?
- RQ3하이드로젤 스플리터 사용, CT 슬라이스 두께의 변화, 정맥 주입 대조제 사용이 시간이 지남에 따라 모델 정확도에 유의미하게 영향을 미치는가?
- RQ4의사의 윤곽선 설정 스타일은 다양한 시기 동안 모델의 DSC 성능에 어느 정도 영향을 미치는가?
- RQ5EMA 곡선과 통계적 검정을 통해 DSC의 시간적 추세를 신뢰성 있게 추적하고 모델의 성능 저하를 탐지할 수 있는가?
주요 결과
- 모델은 2012년부터 2014년 사이에 최고 성능을 보였으며, 전립선, 직장, 방광의 윤곽선에 대해 가장 높은 DSC 값을 기록하였다.
- 2015년 이후 전립선과 직장의 DSC에 유의미한 감소가 관찰되었으며, 방광의 DSC는 시간이 지나도 안정된 상태를 유지하였다.
- 전립선 윤곽선 품질은 의사의 윤곽선 설정 스타일, 하이드로젤 스플리터 사용, CT 슬라이스 두께, 정맥 주입 대조제 사용에 가장 큰 영향을 받았다.
- 직장 윤곽선 품질은 슬라이스 두께, 의사의 윤곽선 설정 스타일, 하이드로젤 스플리터 사용에 의해 유의미하게 영향을 받았다.
- 방광 윤곽선 품질은 주로 정맥 주입(IV) 대조제 사용에 의해 영향을 받았으며, 이외에는 시간에 따른 유의미한 추세가 없었다.
- 이 연구는 데이터 분포의 변화 외에도 변화하는 임상 관행이 도입된 AI 모델의 성능 저하를 이끌 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.