Skip to main content
QUICK REVIEW

[논문 리뷰] Canonical Correlation Analysis for Analyzing Sequences of Medical Billing Codes

Corinne L. Jones, Sham M. Kakade|arXiv (Cornell University)|2016. 12. 01.
Diverticular Disease and Complications참고 문헌 9인용 수 4
한 줄 요약

이 논문은 의료 청구 코드의 시퀀스에서 의미 있는 저차원 특징을 생성하기 위해 정규 상관 분석(CCA)을 제안한다. 이는 진단, 절차 및 약물 간의 관계를 포착한다. 분리된 염증 환자에 적용한 결과, CCA로 유도된 특징은 일대일 인코딩 및 바이그램 특징보다 미래의 선택적 수술 예측에서 성능이 뛰어나며, 특히 정규화된 로지스틱 회귀에서 빠른 학습 속도와 경쟁 가능한 AUC 스코어를 기록했다.

ABSTRACT

We propose using canonical correlation analysis (CCA) to generate features from sequences of medical billing codes. Applying this novel use of CCA to a database of medical billing codes for patients with diverticulitis, we first demonstrate that the CCA embeddings capture meaningful relationships among the codes. We then generate features from these embeddings and establish their usefulness in predicting future elective surgery for diverticulitis, an important marker in efforts for reducing costs in healthcare.

연구 동기 및 목표

  • 의료 청구 데이터의 기계학습에서 특징 생성의 과제를 해결하기 위해, 일대일 인코딩이 청구 코드 간의 관계를 포착하지 못하는 데에 초점한다.
  • CCA가 자연어 처리(NLP)에서 단어 임베딩과 유사하게 의료 청구 코드의 시퀀스 간 잠재적 관계를 효과적으로 모델링할 수 있는지 탐색한다.
  • 특히 분리된 염증 환자에서 선택적 수술를 예측하는 데 있어 CCA로 유도된 특징의 유용성을 평가한다.
  • CCA 특징이 후속 예측 모델링에서 표준 유니그램 및 바이그램 특징과 비교하여 성능에 미치는 영향을 평가한다.
  • CCA 특징이 훨씬 낮은 차원 수와 더 빠른 학습 시간으로 높은 예측 성능를 달성할 수 있음을 보여준다.

제안 방법

  • 각 의료 청구 코드를 문장 내 단어에 비유하여, 슬라이딩 윈도우 크기 ρ 내의 인접 코드로 정의된 맥락을 갖는다.
  • 두 시각: 코드 자체(X)와 그 이웃 코드(Y) 간의 선형 투영 간 상관관계를 최대화하는 방식으로 정규 상관 분석(CCA)을 적용한다.
  • 희귀 및 희박한 코드를 다루기 위해 Tikhonov 정규화를 사용하여 경험적 공분산 행렬을 이용해 CCA 변환 행렬 A와 B를 추정한다.
  • 학습된 A와 B 행렬을 사용하여 각 코드를 25차원 임베딩 공간으로 투영한 후, 초기 진단 이전 및 이후 시간 창에 걸쳐 임베딩을 평균화한다.
  • 평균화된 CCA 임베딩을 기계학습 모델의 입력 특징으로 사용하며, 학습 전에 표준화한다.
  • AUC를 기준으로 그라디언트 부스팅, L2-정규화된 로지스틱 회귀, 랜덤 포레스트를 사용하여 교차 검증 및 하이퍼파ram터 튜닝을 통해 성능을 비교한다.

실험 결과

연구 질문

  • RQ1정규 상관 분석은 자연어 처리(NLP)에서 단어-맥락 관계를 모델링하는 것과 유사하게 의료 청구 코드의 시퀀스 간 관계를 효과적으로 모델링할 수 있는가?
  • RQ2CCA로 유도된 특징은 의미적으로 관련된 코드들에 가까워지는 방식으로 임상적으로 의미 있는 패턴을 포착하는가?
  • RQ3CCA 특징은 분리된 염증 환자에서 선택적 수술 예측에 있어 유니그램 및 바이그램 특징과 비교하여 어떻게 성능을 내는가?
  • RQ4CCA 특징은 훨씬 낮은 특징 차원 수와 더 빠른 학습 시간으로 높은 예측 성능를 달성할 수 있는가?
  • RQ5고차원 입력에 민감한 모델, 예를 들어 정규화된 로지스틱 회귀에서 CCA 특징의 포함 여부가 성능 향상에 기여하는가?

주요 결과

  • CCA 임베딩은 임베딩 공간 내 최근접 이웃이 임상적으로 타당한 관계를 반영함으로써 의료 청구 코드 간의 의미 있는 관계를 효과적으로 포착하였다 (예: 관련 진단 및 약물).
  • 정규화된 로지스틱 회귀에서 CCA 특징은 AUC 0.74 (±0.03)를 기록하여 유니그램(0.58) 및 유니그램+바이그램(0.56) 특징보다 유의미하게 뛰어났다.
  • 그라디언트 부스팅에서 CCA 특징은 AUC 0.74 (±0.04)를 기록하여 최고 성능 특징 세트(유니그램+바이그램, AUC 0.76)와 표준편차 내에 있었다.
  • 모든 모델에서 CCA 특징(50차원)은 유니그램(20,000차원) 및 유니그램+바이그램(240,000차원) 특징보다 훨씬 빠른 학습 시간을 기록했다.
  • 다층 퍼셉트론 기준 모델은 중간 수준의 성능를 보였으며, CCA 특징은 AUC 0.74를 기록하여 유니그램(0.71) 및 유니그램+바이그램(0.70)보다 略적으로 뛰어났다.
  • 결과는 CCA 특징이 입력 차원 수에 민감한 모델에서 전통적 특징 공학의 강력하고 효율적인 대안이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.