Skip to main content
QUICK REVIEW

[論文レビュー] Quantifying Inequality in Underreported Medical Conditions.

Divya Shanmugam, Emma Pierson|arXiv (Cornell University)|Oct 8, 2021
Machine Learning and Data Classification参考文献 31被引用数 4
ひとこと要約

本稿では、共変量シフト仮定の下で、正例未ラベル学習を用いて報告が不完全な医療状態の相対的有病率を推定する新しい手法を提案する。絶対的有病率の推定を必要としないため、人口統計的グループ間での正確な比較が可能になる。合成データおよび実世界の健康データにおいて、ベースラインを上回る性能を示し、共変量シフト仮定の軽微な違反に対しても頑健であることが実証された。

ABSTRACT

Estimating the prevalence of a medical condition, or the proportion of the population in which it occurs, is a fundamental problem in healthcare and public health. Accurate estimates of the relative prevalence across groups -- capturing, for example, that a condition affects women more frequently than men -- facilitate effective and equitable health policy which prioritizes groups who are disproportionately affected by a condition. However, it is difficult to estimate relative prevalence when a medical condition is underreported. In this work, we provide a method for accurately estimating the relative prevalence of underreported medical conditions, building upon the positive unlabeled learning framework. We show that under the commonly made covariate shift assumption -- i.e., that the probability of having a disease conditional on symptoms remains constant across groups -- we can recover the relative prevalence, even without restrictive assumptions commonly made in positive unlabeled learning and even if it is impossible to recover the absolute prevalence. We provide a suite of experiments on synthetic and real health data that demonstrate our method's ability to recover the relative prevalence more accurately than do baselines, and the method's robustness to plausible violations of the covariate shift assumption.

研究の動機と目的

  • 標準的な報告が偏りや不完全性を示す状況において、報告が不十分な医療状態の相対的有病率を推定する課題に対処すること。
  • 絶対的有病率の推定を必要としない手法を開発すること。これは、報告が不十分な状態ではしばしば実行不可能である。
  • 正確に病気にかかっているグループを特定することで、より公平な健康政策を実現すること。
  • 最小限の仮定に依存するよう設計すること。特に、従来の正例未ラベル学習で一般的な制限的な条件を回避すること。
  • 実世界の健康データにおける共変量シフト仮定の妥当な違反に対しても頑健であること。

提案手法

  • 本手法は、診断済み症例を正例、未診断症例を未ラベルとみなす正例未ラベル学習フレームワークを活用する。
  • 共変量シフトを仮定する。すなわち、症状が与えられたもとでの疾患の条件付き確率が、グループ間で一定であると仮定することで、相対的有病率の推定が可能になる。
  • グループ固有の報告バイアスを補正するための再重み付け戦略を用い、相対的有病率比の推定を可能にする。
  • グループ間の分布の乖離を最小化する制約付き最適化問題として推定問題を定式化する。
  • 絶対的有病率の推定を必要とせず、グループ間の相対的割合に焦点を当てる。
  • 経験的リスク最小化とキャリブレーション済み重みを用いることで、共変量シフト仮定のやや強い違反に対しても頑健であるように設計されている。

実験結果

リサーチクエスチョン

  • RQ1絶対的有病率を仮定せずに、報告が不十分な医療状態の相対的有病率を、人口統計的グループ間で正確に推定できるか?
  • RQ2提案手法は、既存の正例未ラベル学習ベースラインと比較して、相対的有病率推定においてどの程度優れているか?
  • RQ3実世界の健康データにおいて、共変量シフト仮定の違反に対して、どの程度の頑健性を示すか?
  • RQ4診断が特定の集団で体系的に報告されない場合でも、本手法は相対的疾患負担が著しく高いグループを特定できるか?
  • RQ5本手法が相対的有病率を回復できるために必要な仮定は何か。それらは先行研究における仮定と比べてどのように異なるか?

主な発見

  • 提案手法は、合成データおよび実健康データの両方において、ベースライン手法よりも顕著に高い精度の相対的有病率推定を達成した。
  • 報告の不備により絶対的有病率が推定不能な状況でも、本手法は相対的有病率比を的確に回復できた。
  • 共変量シフト仮定の妥当な違反に対しても、実際のデータシナリオにおいても精度を維持するという、優れた頑健性を示した。
  • 均一な事前確率や既知のクラス不均衡を仮定するような制限的な仮定に依存する既存の正例未ラベル学習手法よりも優れた性能を示した。
  • 実験により、完全な診断記録が欠落している状況下でも、本手法は相対的疾患負担が著しく高いグループを信頼性高く特定できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。