Skip to main content
QUICK REVIEW

[論文レビュー] Canonical Correlation Analysis for Analyzing Sequences of Medical Billing Codes

Corinne L. Jones, Sham M. Kakade|arXiv (Cornell University)|Dec 1, 2016
Diverticular Disease and Complications参考文献 9被引用数 4
ひとこと要約

本稿では、診断、手術、薬剤の関係を捉えるために、医学的請求コードの系列から低次元で意味のある特徴を生成するために、線形的相関分析(CCA)の使用を提案する。憩室炎患者に適用したところ、CCAによって得られた特徴は、ワンホットおよびバイグラム特徴を上回り、特に正則化付きロジスティック回帰において、より高い予測性能を示した。また、訓練時間が短く、あらゆるモデルで競争力のあるAUCスコアを達成した。

ABSTRACT

We propose using canonical correlation analysis (CCA) to generate features from sequences of medical billing codes. Applying this novel use of CCA to a database of medical billing codes for patients with diverticulitis, we first demonstrate that the CCA embeddings capture meaningful relationships among the codes. We then generate features from these embeddings and establish their usefulness in predicting future elective surgery for diverticulitis, an important marker in efforts for reducing costs in healthcare.

研究の動機と目的

  • ワンホットエンコーディングが請求コード間の関係を捉えられないため、機械学習における医療請求データの特徴生成の課題に対処すること。
  • CCAが、自然言語処理における単語埋め込みと同様に、医学的請求コードの系列における潜在的関係を効果的にモデル化できるかを検討すること。
  • 特に憩室炎の予定外手術を予測するという臨床的関連の出力に対して、CCAから得られる特徴の有効性を評価すること。
  • 下流の予測モデリングにおいて、CCA特徴と標準的なユニグラムおよびバイグラム特徴の性能を比較すること。
  • CCA特徴が顕著に次元削減された状態で、かつ著しく高速な訓練時間を実現しながらも、高い予測性能を達成できることを示すこと。

提案手法

  • 各医学的請求コードを文における単語に類似させ、滑らかなウィンドウサイズρ内の隣接コードによって文脈を定義する。
  • 線形的相関分析(CCA)を適用し、2つのビュー(X:コード自体、Y:隣接コード)を用い、それらの線形射影間の相関を最大化する。
  • 希少で頻度の低いコードに対処するため、Tikhonov正則化を用いた標本共分散行列を用いて、CCA変換行列AおよびBを推定する。
  • 学習されたAおよびB行列を用いて、各コードを25次元の埋め込み空間に射影し、初期診断の前後における時間窓内で埋め込みを平均化する。
  • 平均化されたCCA埋め込みを機械学習モデルの入力特徴として使用し、訓練の前に標準化する。
  • AUCを指標として、交差検証とハイパーパramータチューニングを用い、勾配ブースティング、L2正則化付きロジスティック回帰、ランダムフォレストの各モデルで性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1線形的相関分析は、自然言語処理における単語と文脈の関係と同様に、医学的請求コードの系列間の関係を効果的にモデル化できるか?
  • RQ2CCAから得られる特徴は、意味的に関連するコードに近接するという証拠に基づき、医療請求データに臨床的に意味のあるパターンを捉えているか?
  • RQ3CCA特徴は、憩室炎患者の予定外手術予測において、ユニグラムおよびバイグラム特徴と比較してどのように性能を発揮するか?
  • RQ4CCA特徴は、顕著に次元削減された状態で、かつ著しく高速な訓練時間を実現しながらも、高い予測性能を達成できるか?
  • RQ5正則化付きロジスティック回帰のような高次元入力に敏感なモデルにおいて、CCA特徴の導入が性能向上に寄与するか?

主な発見

  • CCA埋め込みは、埋め込み空間における最近傍探索の結果が臨床的に妥当な関係(例:関連する診断や薬剤)を反映していることから、医学的請求コード間の意味のある関係を効果的に捉えていた。
  • 正則化付きロジスティック回帰では、CCA特徴がAUC 0.74(±0.03)を達成し、ユニグラム特徴(0.58)およびユニグラム+バイグラム特徴(0.56)を顕著に上回った。
  • 勾配ブースティングでは、CCA特徴がAUC 0.74(±0.04)を達成し、最高性能を示した特徴セット(ユニグラム+バイグラム、AUC 0.76)と1標準偏差以内の差であった。
  • すべてのモデルにおいて、CCA特徴(50次元)は、ユニグラム(20,000次元)およびユニグラム+バイグラム(240,000次元)特徴に比べて著しく訓練時間が短かった。
  • マルチレイヤーパーセプトロンのベースラインでは中程度の性能を示し、CCA特徴がAUC 0.74を達成し、ユニグラム(0.71)およびユニグラム+バイグラム(0.70)をわずかに上回った。
  • 結果から、CCA特徴は、入力次元に敏感なモデルにおいて、従来の特徴工学の強力で効率的な代替手段であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。