Skip to main content
QUICK REVIEW

[論文レビュー] Variable subset selection via GA and information complexity in mixtures of Poisson and negative binomial regression models

Tyler Massaro, Hamparsum Bozdogan|arXiv (Cornell University)|May 20, 2015
Bayesian Methods and Mixture Models参考文献 15被引用数 4
ひとこと要約

本稿では、遺伝的アルゴリズム(GA)および情報複雑度基準(AIC、BIC、CAIC、ICOMP)を用いた変数サブセット選択により、過分散カウントデータにおける同質的サブポピュレーションを同定する、ポアソンおよびネガティブバイノミアル回帰モデルの有限混合モデルを提案する。この手法は、テネシー州のHIVカウントデータにおいて4つの明確に異なるサブポピュレーションを特定した。都市部の有無およびノンヒスパニック・ホワイト人口の割合が主な予測因子であった。これにより、疾患負荷の空間的非均質性に関する洞察が得られた。

ABSTRACT

Count data, for example the number of observed cases of a disease in a city, often arise in the fields of healthcare analytics and epidemiology. In this paper, we consider performing regression on multivariate data in which our outcome is a count. Specifically, we derive log-likelihood functions for finite mixtures of regression models involving counts that come from a Poisson distribution, as well as a negative binomial distribution when the counts are significantly overdispersed. Within our proposed modeling framework, we carry out optimal component selection using the information criteria scores AIC, BIC, CAIC, and ICOMP. We demonstrate applications of our approach on simulated data, as well as on a real data set of HIV cases in Tennessee counties from the year 2010. Finally, using a genetic algorithm within our framework, we perform variable subset selection to determine the covariates that are most responsible for categorizing Tennessee counties. This leads to some interesting insights into the traits of counties that have high HIV counts.

研究の動機と目的

  • 疫学的研究で一般的に見られる過分散カウントデータに対して、ポアソンおよびネガティブバイノミアル回帰を用いた有限混合モデルでサブポピュレーションをモデル化することにより、過分散を扱う。
  • 情報基準(AIC、BIC、CAIC、ICOMP)を用いて、有限混合モデルにおける最適なコンポーネント数を体系的に同定すること。
  • 遺伝的アルゴリズム(GA)を用いた変数サブセット選択により、郡を明確に分類するための最も影響力のある共変量を同定すること。
  • 主観的なコンポーネント数の選択を回避し、公衆衛生アナリティクスにおける解釈可能性を向上させるデータ駆動型のモデル選択アプローチを提供すること。

提案手法

  • 過分散カウントデータを扱うために、ポアソンおよびネガティブバイノミアル(NB-2)回帰モデルの有限混合の対数尤度関数を定式化する。
  • AIC、BIC、CAIC、ICOMPの情報複雑度基準を適用し、最適な混合コンポーネント数を客観的に選択する。
  • 8つの予測子を含むテネシー州HIVデータセットにおいて、遺伝的アルゴリズム(GA)を用いて変数サブセット選択を実施し、最も情報量の多い共変量を同定する。
  • ICOMPにおける逆フィッシャー情報行列(IFIM)を用いてモデルの複雑さをペナルティ化し、モデル選択の正確性を向上させる。
  • 選択された変数を用いて有限混合モデルをフィットし、コンポーネントごとの回帰係数を評価することで、サブポピュレーションの特徴を解釈する。
  • シミュレーテッドデータおよび2010年のHIV症例数を含む95カウントの実データセットを用いて、手法の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1情報基準を用いて、HIV症例数に基づくテネシー州の郡における最適な同質的サブポピュレーション数は何か。この数はどのように特定されるか。
  • RQ2変数サブセット選択を通じて、HIV負荷の観点からサブポピュレーションを区別する上で、最も寄与する共変量は何か。
  • RQ3有限混合モデルによって同定された明確なサブポピュレーションごとに、共変量(例:都市部の有無、人種/エスニシティ)の効果はどのように変化するか。
  • RQ4人口規模は、農村部と都市部の両方における社会経済的指標とHIV発生率の関係をどの程度歪めているか。
  • RQ5提案されたフレームワークは、過分散カウントデータにおいて、標準的なポアソンまたはNB-2回帰と比較して、モデルの適合度と解釈可能性を向上させることができるか。

主な発見

  • 最適な有限混合モデルとして4つのコンポーネントが選択され、郡の4つの明確に異なるサブポピュレーションが、異なるHIV症例率パターンを示していることが判明した。
  • 遺伝的アルゴリズムにより、変数4(都市部インジケータ)および変数7(ノンヒスパニック・ホワイトの割合)が最も頻繁に選択され、強い予測力を持つことが示された。
  • 変数1、3、4、5、7(都市部の有無およびノンヒスパニック・ホワイトの割合を含む)を含むモデルが、最小のAIC(708.76)、CAIC(776.89)、SBC(756.89)スコアを達成し、最良の適合度を示した。
  • 4つのコンポーネントのうち3つにおいて、ノンヒスパニック・ホワイト人口の割合が、高いHIV症例数に対する有意な保護要因であった。一方、都市部の有無は有意なリスク要因であった。
  • 貧困率、失業率、および高校卒業以下教育水準は、コンポーネントを介して低下したが、都市インジケータおよびマイノリティの割合は増加した。これは、より都市的かつ多様性の高い郡が、高いHIV症例数を示す傾向にあることを示している。
  • 最高のHIV症例数は、ナッシュビル、メンフィス、ノックスビル、チャタヌーガといった主要都市と関連しており、都市部における疾患負荷の集中が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。