Skip to main content
QUICK REVIEW

[論文レビュー] Cost-Sensitive Diagnosis and Learning Leveraging Public Health Data

Mohammad Kachuee, Kimmo Kärkkäinen|arXiv (Cornell University)|Feb 19, 2019
Machine Learning in Healthcare参考文献 25被引用数 6
ひとこと要約

本稿は、NHANESから得た約10万件の個人データの新しいデータセットを用いて、医療応用におけるコストセンシティブな学習フレームワークを提案する。特徴量の収集コストはクラウドソーシング調査により実際のコストを抽出している。糖尿病、心疾患、高血圧症の分類タスクにおいて、感度ベース、強化学習、グリーディー収集戦略といった最先端の手法を評価し、コストに配慮した特徴量選択が予測の効率性を向上させるとともに、患者の負担とデータ収集コストを低減することを示している。

ABSTRACT

Traditionally, machine learning algorithms rely on the assumption that all features of a given dataset are available for free. However, there are many concerns such as monetary data collection costs, patient discomfort in medical procedures, and privacy impacts of data collection that require careful consideration in any real-world health analytics system. An efficient solution would only acquire a subset of features based on the value it provides while considering acquisition costs. Moreover, datasets that provide feature costs are very limited, especially in healthcare. In this paper, we provide a health dataset as well as a method for assigning feature costs based on the total level of inconvenience asking for each feature entails. Furthermore, based on the suggested dataset, we provide a comparison of recent and state-of-the-art approaches to cost-sensitive feature acquisition and learning. Specifically, we analyze the performance of major sensitivity-based and reinforcement learning based methods in the literature on three different problems in the health domain, including diabetes, heart disease, and hypertension classification.

研究の動機と目的

  • 医療機械学習分野において、実世界の特徴量コストデータの不足に取り組むこと、特にコストセンシティブな診断に関して。
  • 患者の不快感、プライバシー、金銭的要因に基づいた、現実的で人間が関与した特徴量収集コストの割り当て手法を構築すること。
  • 感度ベース、強化学習、グリーディー収集といった最先端のコストセンシティブな学習手法を、実際の健康分類タスク上で評価・比較すること。
  • 予測時に高価値・低コストの特徴量を優先することで、より効率的で患者に配慮し、コスト効率の良い診断システムを実現すること。
  • 今後の研究を支援するため、特徴量コストを含む公開データセットを提供すること。

提案手法

  • NHANES(1999–2016)から、約10万人の個人について、人口統計、血液検査結果、身体検査、アンケートデータを統合した包括的な健康データセットを構築した。
  • Amazon Mechanical Turkを用いたクラウドソーシング調査により、各特徴量の「不快感」を0〜5のスケールで参加者が評価した。
  • 調査結果を線形変換を用いてコスト値に変換し、データ収集における実際のトレードオフを反映するようにした。
  • 主な4つのコストセンシティブな学習手法を評価した:OL(オポチュニスティック・ラーニング)、FACT(信頼度しきい値に基づく特徴量収集)、全探索、RLベース(強化学習)手法。
  • 特徴量収集プロセスを段階的意思決定問題として定式化し、モデルが予測された価値対コスト比に基づいて動的に特徴量を選択するようにした。
  • 標準的な分類モデル(例:ロジスティック回帰、ランダムフォレスト)をベース予測器として用い、コストに配慮した収集ポリシーを推論時のみに適用した。

実験結果

リサーチクエスチョン

  • RQ1実際の特徴量コストが使用される状況下で、異なるコストセンシティブな特徴量収集戦略は、実世界の健康分類タスクにおいてどのように性能を発揮するか?
  • RQ2人間の認識に基づく実世界のコストデータを組み込むことで、医療分野における機械学習の実用性と効率性はどの程度向上するか?
  • RQ3糖尿病、心疾患、高血圧症の診断において、感度ベース、強化学習、グリーディー収集のうち、どの手法が精度と特徴量収集コストのバランスを最も良く実現するか?
  • RQ4実際の特徴量コストを含む公開データセットは、健康情報学におけるコストセンシティブな学習アルゴリズムのより信頼性の高いベンチマークを可能にするか?
  • RQ5従来の全特徴量アプローチと比較して、動的で文脈に応じた特徴量収集は、患者の負担とデータ収集コストをどの程度低減できるか?

主な発見

  • 提案されたデータセットには、約10万人の個人と、1万件を超える一意の変数が含まれており、実際のヒトによる推定コストが付与されている。
  • クラウドソーシングによる不快感評価に基づくコスト割り当て手法により、0〜5の現実的でスケーラブルなコストスケールが得られ、実際の患者および臨床現場のトレードオフを反映していた。
  • 強化学習ベースおよび感度ベースの手法(例:FACT)が、全3つの健康分類タスクにおいて、グリーディー法や全探索法を上回り、精度とコストのバランスを優れて達成した。
  • 高血圧症分類タスクでは、OL(オポチュニスティック・ラーニング)法が低コスト水準で最高の精度を達成し、特徴量選択の高い効率性を示した。
  • 精度対コスト曲線から、感度ベース手法(FACT)が低コスト収集しきい値でも高い性能を維持していることが明らかになり、実用的有用性が顕著に示された。
  • 本研究では、特徴量収集コストがモデルの導入に重要な要因であることが判明し、これを無視すると非最適で高コストかつ患者の協力性が低い診断ワークフローが生じることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。