Skip to main content
QUICK REVIEW

[논문 리뷰] Generalizability of Machine Learning Models: Quantitative Evaluation of Three Methodological Pitfalls

Farhad Maleki, Katie Ovens|arXiv (Cornell University)|2022. 02. 01.
AI in cancer detection인용 수 7
한 줄 요약

이 논문은 건강정보 분야에서 기계학습 모델의 일반화 능력을 떨어뜨리는 세 가지 핵심 방법론적 함정을 규명하고 정량적으로 평가한다: 잘못된 데이터 분할으로 인한 데이터 누출(예: 분할 이전에 오버샘플링 및 특징 선택), 동일 환자로부터의 데이터가 학습/검증/테스트 세트에 무작위로 분포하여 발생하는 환자 수준의 데이터 누출, 그리고 부적절한 성능 지표 또는 기준 모델. 연구에서는 이러한 오류가 F1 스코어를 최대 71.2%까지 과대평가할 수 있으며, 새로운 데이터에서 모델이 치명적인 실패를 겪을 수 있음을 입증하여, 모델 개발 및 평가 시 방법론적 엄격함이 절실하게 필요하다고 강조한다.

ABSTRACT

Purpose: Despite the potential of machine learning models, the lack of generalizability has hindered their widespread adoption in clinical practice. We investigate three methodological pitfalls: (1) violation of independence assumption, (2) model evaluation with an inappropriate performance indicator or baseline for comparison, and (3) batch effect. Materials and Methods: Using several retrospective datasets, we implement machine learning models with and without the pitfalls to quantitatively illustrate these pitfalls' effect on model generalizability. Results: Violation of independence assumption, more specifically, applying oversampling, feature selection, and data augmentation before splitting data into train, validation, and test sets, respectively, led to misleading and superficial gains in F1 scores of 71.2% in predicting local recurrence and 5.0% in predicting 3-year overall survival in head and neck cancer as well as 46.0% in distinguishing histopathological patterns in lung cancer. Further, randomly distributing data points for a subject across training, validation, and test sets led to a 21.8% superficial increase in F1 score. Also, we showed the importance of the choice of performance measures and baseline for comparison. In the presence of batch effect, a model built for pneumonia detection led to F1 score of 98.7%. However, when the same model was applied to a new dataset of normal patients, it only correctly classified 3.86% of the samples. Conclusions: These methodological pitfalls cannot be captured using internal model evaluation, and the inaccurate predictions made by such models may lead to wrong conclusions and interpretations. Therefore, understanding and avoiding these pitfalls is necessary for developing generalizable models.

연구 동기 및 목표

  • 임상 환경에서 기계학습 모델의 일반화 능력을 떨어뜨리는 일반적인 방법론적 오류가 어떻게 작용하는지 조사하기.
  • 학습/검증/테스트 분할 이전에 오버샘플링, 특징 선택, 데이터 증강을 수행함으로써 발생하는 잘못된 데이터 분할으로 인한 데이터 누출이 모델 성능에 미치는 영향을 정량화하기.
  • 동일 환자의 데이터 포인트가 학습, 검증, 테스트 세트에 무작위로 분포되는 경우 발생하는 환자 수준의 데이터 누출이 모델 일반화 능력과 F1 스코어에 미치는 영향 평가하기.
  • 성능 지표 선택 및 기준 모델 비교 방식이 모델 평가 결과에 미치는 영향 평가하기.
  • 폐렴 검출을 사례 연구로 삼아 배치 효과가 모델 성능에 미치는 실제 영향을 입증하기.

제안 방법

  • 저자들은 두부·경부암, 폐암, 폐렴 영상 데이터로부터 수집한 후향적 임상 데이터셋을 사용하여 기계학습 모델을 훈련하고 평가한다.
  • 세 가지 방법론적 함정이 있는 모델과 없는 모델을 각각 구현하여 이들의 영향을 고립하고 정량화한다.
  • 데이터 누출 평가를 위해 데이터를 학습/검증/테스트 세트로 분할하기 이전에 오버샘플링, 특징 선택, 데이터 증강을 적용한다.
  • 환자 수준의 누출 평가를 위해 동일 환자의 데이터 포인트를 학습, 검증, 테스트 세트에 무작위로 분배하여 독립성 가정을 위반한다.
  • 표준 지표(예: F1 스코어)를 사용하여 모델 성능을 평가하고 적절한 기준 모델과 비교하여 지표 선택의 영향을 분석한다.
  • 새로운 독립적인 정상 환자 데이터셋에 대해 기존 데이터셋에서 훈련된 폐렴 검출 모델을 적용하여 모델의 강건성과 배치 효과의 영향을 평가한다.

실험 결과

연구 질문

  • RQ1학습/검증/테스트 분할 이전에 오버샘플링 및 특징 선택 등의 데이터 전처리 기법을 적용할 경우, 모델 성능 지표가 얼마나 과대평가되는가?
  • RQ2동일 환자의 데이터 포인트가 학습, 검증, 테스트 세트에 무작위로 분포할 경우, 모델의 일반화 능력과 F1 스코어에 어떤 영향을 미치는가?
  • RQ3성능 지표 선택 및 기준 모델 비교 방식이 기계학습 모델의 효과성 평가에 미치는 영향은 어떠한가?
  • RQ4새로운 독립적인 데이터셋에 적용했을 때, 배치 효과가 모델의 일반화 능력에 얼마나 심각하게 영향을 미치는가?
  • RQ5내부 모델 평가만으로는 이러한 방법론적 함정을 탐지할 수 있는가?

주요 결과

  • 학습/검증/테스트 분할 이전에 오버샘플링, 특징 선택, 데이터 증강을 적용한 결과, 두부·경부암에서 국소 재발 예측에 대해 F1 스코어가 71.2% 과대평가되었다.
  • 동일 환자의 데이터 포인트가 세트에 무작위로 분포하여 발생한 환자 수준의 누출로 인해 F1 스코어가 21.8% 인위적으로 상승했으며, 이는 심각한 데이터 누출을 보여준다.
  • 폐암 조직형태 분류 작업에서 데이터 누출로 인해 F1 스코어가 46.0% 과대평가되어 모델 성능이 심각하게 과대평가됨을 확인하였다.
  • 배치 효과가 존재하는 상황에서 폐렴 검출 모델은 훈련 데이터셋에서는 F1 스코어가 98.7%였지만, 새로운 정상 환자 데이터셋에서는 정확도가 3.86%에 불과하여 분포 외부 데이터에서 치명적인 실패를 겪었다.
  • 이 연구는 이러한 함정들이 내부 모델 평가만으로는 탐지되지 않으며, 일반화 능력이 열악한데도 성능이 우수하게 보일 수 있음을 확인하였다.
  • 결과적으로 부적절한 성능 지표와 기준 모델은 특히 불균형하거나 편향된 데이터셋에서 연구자가 모델이 효과적이라고 잘못 인식하게 만들 수 있음을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.