Skip to main content
QUICK REVIEW

[논문 리뷰] The Future AI in Healthcare: A Tsunami of False Alarms or a Product of Experts?

Gari D. Clifford|arXiv (Cornell University)|2020. 07. 20.
Healthcare Technology and Patient Monitoring참고 문헌 37인용 수 4
한 줄 요약

이 논문은 임상 데이터에 기반한 AI 모델의 과적합, 편향 및 일반화 능력 부족 문제를 해결하기 위해 독립적으로 훈련된 다양한 기계학습 모델의 투표 앙상블을 제안한다. 성능, 독립성, 맥락적 특징을 기반으로 가중치를 적용한 알고리즘 조합을 통해 예측 정확도를 향상시키고 임상적으로 유의미한 신뢰구간을 제공하며, 공개 챌린지가 이러한 앙상블를 생성하고 연구를 가속화하는 확장 가능한 메커니즘으로 기능한다.

ABSTRACT

Recent significant increases in affordable and accessible computational power and data storage have enabled machine learning to provide almost unbelievable classification and prediction performances compared to well-trained humans. There have been some promising (but limited) results in the complex healthcare landscape, particularly in imaging. This promise has led some individuals to leap to the conclusion that we will solve an ever-increasing number of problems in human health and medicine by applying `artificial intelligence' to `big (medical) data'. The scientific literature has been inundated with algorithms, outstripping our ability to review them effectively. Unfortunately, I argue that most, if not all of these publications or commercial algorithms make several fundamental errors. I argue that because everyone (and therefore every algorithm) has blind spots, there are multiple `best' algorithms, each of which excels on different types of patients or in different contexts. Consequently, we should vote many algorithms together, weighted by their overall performance, their independence from each other, and a set of features that define the context (i.e., the features that maximally discriminate between the situations when one algorithm outperforms another). This approach not only provides a better performing classifier or predictor but provides confidence intervals so that a clinician can judge how to respond to an alert. Moreover, I argue that a sufficient number of (mostly) independent algorithms that address the same problem can be generated through a large international competition/challenge, lasting many months and define the conditions for a successful event. Finally, I propose introducing the requirement for major grantees to run challenges in the final year of funding to maximize the value of research and select a new generation of grantees.

연구 동기 및 목표

  • 후행적 의료 데이터에 기반해 훈련된 건강의료 AI 모델에서 널리 퍼져 있는 과적합과 일반화 능력 부족 문제를 해결하기 위해.
  • 임상 환경에서 해석 가능성과 신뢰도 추정이 부족한 단일 알고리즘 예측의 경향을 줄이기 위해.
  • 다양한 알고리즘을 성능 가중치 기반으로 융합하여 강건성과 신뢰도를 향상시키는 프레임워크를 제안하기 위해.
  • 다양하고 높은 성능을 내는, 독립적으로 개발된 AI 모델들을 생성하기 위한 메커니즘으로 공개 챌린지를 주장하기 위해.
  • 주요 보조금을 수여하는 과정에서 챌린지 기반 평가 및 최고 성과를 낸 팀에 대한 후속 지원을 의무화함으로써 연구 영향을 극대화하기 위해.

제안 방법

  • 동일한 임상 데이터를 기반으로 훈련된 다수의 독립적인 기계학습 알고리즘을 확보하기 위해 공개적이고 접근 가능한 챌린지(PhysioNet를 모델로 삼음)를 활용한다.
  • 각 알고리즘을 성능, 타 알고리즘과의 독립성, 그리고 특정 상황에서 우수한 성능를 발휘할 수 있는 맥락적 관련성(특징)에 따라 앙상블 내에서 가중치를 부여한다.
  • 성능 가중치 기반 점수를 활용해 예측 결과를 집계하여 더 강건한 최종 분류 또는 예측 결과를 도출하는 투표 시스템을 적용한다.
  • 앙상블 출력에 신뢰구간을 통합하여 임상의가 예측의 신뢰도와 대응의 긴급성을 평가할 수 있도록 지원한다.
  • 대규모 국제적 참여를 통해 다양한 알고리즘 접근 방식을 생성하여 단일 모델보다 우수한 성능을 내는 집단적 성능을 달성한다.
  • 주요 보조금 수여 과정에서 최종 해에 챌린지를 개최하고, 최고 성과를 낸 팀에게 후속 보조금을 수여하는 자금 지원 모델을 도입한다.

실험 결과

연구 질문

  • RQ1다양하고 독립적으로 훈련된 기계학습 모델의 투표 앙상블이 건강의료 분야에서 임상 이벤트를 예측하는 데 있어 단일 모델을 뛰어넘을 수 있는가?
  • RQ2임상 의사결정을 지원하기 위해 AI 예측에 의미 있는 신뢰구간을 어떻게 통합할 수 있는가?
  • RQ3공개 챌린지는 임상 예측 작업을 위한 다양하고 높은 성능를 내며 일반화 가능한 AI 모델들을 얼마나 효과적으로 생성할 수 있는가?
  • RQ4훈련 데이터의 편향과 모델 개발 환경은 알고리즘 성능 및 일반화 능력에 어떤 영향을 미치는가?
  • RQ5챌린지 기반 평가가 연구 생산성과 혁신을 향상시키기 위해 전통적인 동료 심사 기반 보조금 수여 방식을 대체하거나 보완할 수 있는가?

주요 결과

  • 현재 널리 사용되는 건강의료 분야의 AI 모델들은 특정 훈련 세트에 과적합되어 있으며, 다양한 환자 집단이나 임상 환경 간에 일반화되지 못한다.
  • 성능, 독립성, 맥락적 특징에 따라 가중치를 적용한 다양한 알고리즘의 투표 앙상블은 예측 정확도와 신뢰도를 크게 향상시킨다.
  • 공개 챌린지—예를 들어 PhysioNet/CinC 시리즈—는 대규모 국제적 협업이 충분한 수의 독립적이고 고성능 모델을 생성할 수 있음을 보여준다.
  • 앙상블 예측에서 유도된 신뢰구간은 임상의가 경고의 신뢰도를 평가하고 즉각 조치를 취할지, 연기할지, 재검사할지 결정하는 데 도움을 준다.
  • 현재의 보조금 제도는 동료 심사 점수와 실제 연구 생산성 간의 상관관계가 떨어지는 경향이 있어, 대안적 평가 메커니즘이 필요하다는 것을 시사한다.
  • 챌린지 기반 평가 및 최고 성과 팀에 대한 후속 자금 지원을 의무화할 경우 연구 가치를 극대화하고 임상적으로 유용한 AI 도구의 개발을 가속화할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.