[논문 리뷰] Using massive health insurance claims data to predict very high-cost claimants: a machine learning approach
이 연구는 4800만 명의 환자에서 확보한 클레임 데이터를 사용하여 연간 비용이 25만 달러를 초과하는 매우 높은 비용의 클레임 수령자(HiCCs)를 예측하는 기계학습 모델을 개발한다. 최고의 모델은 0.99 위험 기준에서 AUC 91.2%와 정밀도 74%를 달성하여, 타겟팅된 케어 관리 프로그램을 통해 연간 순 수익 730만 달러를 창출할 수 있다.
Due to escalating healthcare costs, accurately predicting which patients will incur high costs is an important task for payers and providers of healthcare. High-cost claimants (HiCCs) are patients who have annual costs above $\$250,000$ and who represent just 0.16% of the insured population but currently account for 9% of all healthcare costs. In this study, we aimed to develop a high-performance algorithm to predict HiCCs to inform a novel care management system. Using health insurance claims from 48 million people and augmented with census data, we applied machine learning to train binary classification models to calculate the personal risk of HiCC. To train the models, we developed a platform starting with 6,006 variables across all clinical and demographic dimensions and constructed over one hundred candidate models. The best model achieved an area under the receiver operating characteristic curve of 91.2%. The model exceeds the highest published performance (84%) and remains high for patients with no prior history of high-cost status (89%), who have less than a full year of enrollment (87%), or lack pharmacy claims data (88%). It attains an area under the precision-recall curve of 23.1%, and precision of 74% at a threshold of 0.99. A care management program enrolling 500 people with the highest HiCC risk is expected to treat 199 true HiCCs and generate a net savings of $\$7.3$ million per year. Our results demonstrate that high-performing predictive models can be constructed using claims data and publicly available data alone, even for rare high-cost claimants exceeding $\$250,000$. Our model demonstrates the transformational power of machine learning and artificial intelligence in care management, which would allow healthcare payers and providers to introduce the next generation of care management programs.
연구 동기 및 목표
- 대규모 보험 가입자 집단에서 매우 높은 비용의 클레임 수령자(HiCCs)를 식별하기 위한 고성능 예측 모델을 개발하는 것.
- 기존 방법을 향상시키기 위해 대규모 클레임 데이터와 인구통계학적 데이터를 활용하여 희귀한 고비용 환자의 예측 정확도를 향상시키는 것.
- 연간 의료비가 25만 달러를 초과할 가능성이 가장 높은 환자를 조기에 식별하여 사전 케어 관리 프로그램을 운영하는 것.
- 단기간에만 가입된 환자, 약물 정보가 없는 환자, 이전에 고비용 환자로 기록되지 않은 환자 등 도전적인 하위집단에서의 모델 성능을 평가하는 것.
- 위험 기반 케어 관리 프로그램을 도입할 경우 예상 재정적 영향을 추정하는 것.
제안 방법
- 4800만 명의 환자에서 확보한 임상, 인구통계학적, 클레임 기반 특성의 총 6,006개 변수를 사용하여 예측 모델을 구축하였다.
- 환자 수준의 특성을 향상시키기 위해 공개된 인구통계학적 데이터를 클레임 데이터에 통합하였다.
- 감독 기반 기계학습 기법을 사용하여 100여 개 이상의 이진 분류 모델을 훈련하고 비교하였다.
- 특이도와 정밀도를 높이는 데 중점을 두고 AUC-ROC 및 정밀도-재현율 곡선 지표를 사용하여 모델 성능을 최적화하였다.
- 고위험 기준 0.99에서 AUC-ROC(91.2%)와 정밀도를 기준으로 최고 성능을 보인 모델을 선정하였다.
- 상위 500명의 고위험 환자를 대상으로 케어 관리 프로그램을 시뮬레이션하여 순 재정적 수익을 추정하였다.
실험 결과
연구 질문
- RQ1대규모 클레임 데이터와 인구통계학적 데이터를 기반으로 훈련된 기계학습 모델이 연간 의료비가 25만 달러를 초과하는 환자를 정확하게 예측할 수 있는가?
- RQ2예상치 못한 데이터 부족 상황(예: 전체 연도 동안의 가입 기간이 없거나 약물 클레임이 없는 환자 등)에서 모델의 성능은 어떻게 변화하는가?
- RQ3고위험 예측 기반의 타겟팅된 케어 관리 프로그램을 도입할 경우 예상되는 재정적 영향은 무엇인가?
- RQ4이 모델의 성능은 이전에 발표된 HiCC 예측 방법과 비교해 어떻게 다른가?
- RQ5고위험 기준(예: 0.99)에서 높은 정밀도를 유지할 수 있는가? 이는 임상적 개입 프로그램에서 잘못된 경고를 최소화하는 데 기여하는가?
주요 결과
- 최고의 기계학습 모델은 수확률 곡선 아래 면적(AUC)이 91.2%를 기록하여 이전에 보고된 최고 기준인 84%를 크게 뛰어넘었다.
- 모델은 도전적인 하위집단에서도 뛰어난 성능을 유지했다: 이전에 고비용 환자로 기록되지 않은 환자에서 AUC 89%, 전체 연도 동안 가입하지 않은 환자에서 AUC 87%, 약물 클레임이 없는 환자에서 AUC 88%를 기록하였다.
- 위험 기준 0.99에서 모델은 정밀도 74%를 달성하여, 고위험으로 분류된 환자 중 74%가 실제로 진정한 HiCCs임을 시사했다.
- 정밀도-재현율 곡선 아래 면적은 23.1%로, 희귀 사건을 높은 정밀도로 식별하는 데 뛰어난 성능을 보였다.
- 상위 500명의 고위험 환자를 대상으로 시뮬레이션한 케어 관리 프로그램은 199명의 진정한 HiCCs를 식별했으며, 연간 순 수익 약 730만 달러를 창출할 것으로 추정되었다.
- 결과적으로, 임상 기록이나 전자건강기록(EHR)이 없더라도 클레임 데이터와 공개된 데이터만으로도 희귀한 매우 높은 비용의 환자를 정확히 예측할 수 있는 고성능 예측 모델을 구축할 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.