[논문 리뷰] The Worrisome Impact of an Inter-rater Bias on Neural Network Training
이 논문은 수동 의료 영상 주석에서의 평가자 간 편향이 딥 뉴럴 네트워크(DNN) 학습을 심각하게 왜곡하여 동일한 아키텍처를 사용하더라도 분할 결과가 일관성 없이 나타나게 한다는 점을 입증한다. 특히 경험이 적은 평가자로부터의 주석을 기반으로 학습시킬 경우, DNN는 서로 다른 평가자의 주석을 기반으로 테스트할 때 더 낮은 Dice 점수를 보이며, 원래 주석과 비교해 DNN 예측을 더 정확히 분류할 수 있는 분류기 DNN가 존재함으로써 학습된 표현에서 편향이 증폭됨을 시사한다.
The problem of inter-rater variability is often discussed in the context of manual labeling of medical images. The emergence of data-driven approaches such as Deep Neural Networks (DNNs) brought this issue of raters' disagreement to the front-stage. In this paper, we highlight the issue of inter-rater bias as opposed to random inter-observer variability and demonstrate its influence on DNN training, leading to different segmentation results for the same input images. In fact, lower overlap scores are obtained between the outputs of a DNN trained on annotations of one rater and tested on another. Moreover, we demonstrate that inter-rater bias in the training examples is amplified and becomes more consistent, considering the segmentation predictions of the DNNs' test data. We support our findings by showing that a classifier-DNN trained to distinguish between raters based on their manual annotations performs better when the automatic segmentation predictions rather than the actual raters' annotations were tested. For this study, we used two different datasets: the ISBI 2015 Multiple Sclerosis (MS) challenge dataset, including MRI scans each with annotations provided by two raters with different levels of expertise; and Intracerebral Hemorrhage (ICH) CT scans with manual and semi-manual segmentations. The results obtained allow us to underline a worrisome clinical implication of a DNN bias induced by an inter-rater bias during training. Specifically, we present a consistent underestimate of MS-lesion loads when calculated from segmentation predictions of a DNN trained on input provided by the less experienced rater. In the same manner, the differences in ICH volumes calculated based on outputs of identical DNNs, each trained on annotations from a different source are more consistent and larger than the differences in volumes between the manual and semi-manual annotations used for training.
연구 동기 및 목표
- 수동 의료 영상 분할에서의 평가자 간 편향(랜덤 변동과는 다름)이 딥 러닝 기반 의료 영상 분할에 미치는 영향을 조사하는 것.
- 평가자의 전문성 수준이나 주석 스타일의 차이가 DNN 학습 및 테스트 성능에 미치는 영향을 정량화하는 것.
- 동일한 아키텍처를 사용하더라도 서로 다른 평가자로부터의 주석을 기반으로 학습된 DNN가 분할 결과를 체계적으로 다르게 출력하는가를 입증하는 것.
- 학습 과정에서 유입된 편향이 DNN의 예측에서 증폭되는가 평가하여, 원래 주석보다 DNN 예측을 더 쉽게 분류할 수 있는지 확인하는 것.
- 다양한 평가자로부터의 주석을 혼합하여 사용하는 훈련 전략을 제안하고, 이를 통해 편향을 완화하고 모델의 강건성을 향상시키는 것.
제안 방법
- MS-lesion MRI 및 ICH-CT 데이터셋에 대해 두 명의 다른 평가자로부터의 분할 주석을 기반으로 U-Net 기반 DNN를 학습시켰다.
- 교차 평가를 통해 모델 성능을 평가: 한 평가자의 주석으로 학습하고 다른 평가자의 주석으로 테스트하며, Dice 점수를 측정하였다.
- 분류기 DNN를 별도로 학습시켜, 서로 다른 평가자로부터의 분할 결과를 식별하도록 하였으며, 원래 수동 주석과 DNN 예측 출력을 입력으로 사용하였다.
- 원래 주석과 DNN 예측 간의 분류 정확도를 비교하여, 학습된 표현에서 편향이 증폭되었는지 평가하였다.
- 다양한 전문가 및 경험이 적은 평가자 주석의 비율을 조절하여, 두 평가자로부터의 분할 결과를 가중 평균한 혼합 훈련 방식을 제안하고 평가하였다.
- 표준 지표(Dice 점수, 히트율)를 사용하여 분할 일관성 및 분류기 성능의 차이를 정량화하였다.
실험 결과
연구 질문
- RQ1수동 주석에서의 평가자 간 편향은 그 주석을 기반으로 학습된 DNN의 분할 성능에 어떻게 영향을 미치는가?
- RQ2다른 평가자로부터의 주석을 기반으로 학습된 DNN가 동일한 입력 영상에 대해 유의미하게 다른 분할 결과를 출력하는가?
- RQ3평가자 간 편향이 DNN의 예측에서 증폭되는가? 즉, 원래 주석보다 DNN 예측을 더 쉽게 분류할 수 있는가?
- RQ4DNN 예측을 사용할 경우, 원래 주석보다 서로 다른 평가자로부터의 분할 결과를 더 정확히 분류할 수 있는가?
- RQ5훈련 데이터에 소량의 전문가 주석을 포함시킴으로써 DNN 분할 결과의 편향을 줄일 수 있는가?
주요 결과
- 다른 평가자로부터의 주석을 기반으로 학습된 DNN 간 교차 평가에서 유의미하게 낮은 Dice 점수를 기록: MS-lesion의 경우 0.77±0.04, ICH의 경우 0.79±0.07로, 테스트 데이터가 다른 평가자로부터 올 경우 성능 저하가 발생함을 시사한다.
- 분류기 DNN는 DNN 예측을 기반으로 한 경우 원래 수동 주석을 기반으로 한 경우보다 높은 히트율(0.93±0.03)을 기록하였으며, 이는 학습된 표현에서 편향이 증폭됨을 보여준다.
- ICH 데이터셋의 경우, DNN 예측 기반 분류의 히트율은 0.95±0.04였고, 원래 주석 기반 분류의 히트율은 0.917±0.06이었으며, 이는 모델 출력에서 편향의 일관성이 향상됨을 확인한다.
- 연구 결과, 경험이 적은 평가자로부터의 주석을 기반으로 학습된 DNN는 MS-lesion 부위의 크기를 일관되게 과소 평가하는 경향을 보였으며, 이는 질병 부담 추정에서 임상적으로 중요한 편향을 의미한다.
- 동일한 DNN 아키텍처와 훈련 방식을 사용하더라도, 서로 다른 평가자로부터의 주석을 기반으로 학습된 모델은 서로 다른 결과를 도출함을 확인하였으며, 이는 모델 행동이 훈련 데이터 내 평가자 특화 편향에 의해 결정됨을 시사한다.
- 훈련 데이터에 소량의 전문가 주석(예: 5/16 또는 6/16)을 포함시킴으로써 분할 결과의 일관성이 향상되고 편향이 감소함을 확인하였으며, 이는 실용적인 완화 전략임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.