Skip to main content
QUICK REVIEW

[論文レビュー] Model-aware Quantile Regression for Discrete Data

Tullia Padellini, Håvard Rue|arXiv (Cornell University)|Apr 10, 2018
Neural Networks and Applications被引用数 4
ひとこと要約

本稿では、離散応答変数(例:ポアソン分布、二項分布)に対して、分布固有の連続的補間を用いて分位数関数を構築することで、モデルに適合した分位数回帰手法を提案する。これにより、適切な不確実性の評価が可能となり、分位数の交差を軽減できる。この手法は真の応答分布を分位数モデリングの枠組みに統合しており、R-INLAによるベイズ推論を可能にし、疾患マッピング応用における解釈可能性とロバスト性を向上させる。

ABSTRACT

Quantile regression relates the quantile of the response to a linear predictor. For a discrete response distributions, like the Poission, Binomial and the negative Binomial, this approach is not feasible as the quantile function is not bijective. We argue to use a continuous model-aware interpolation of the quantile function, allowing for proper quantile inference while retaining model interpretation. This approach allows for proper uncertainty quantification and mitigates the issue of quantile crossing. Our reanalysis of hospitalisation data considered in Congdon (2017) shows the advantages of our proposal as well as introducing a novel method to exploit quantile regression in the context of disease mapping.

研究の動機と目的

  • 計数のような離散応答変数に標準的な分位数回帰を適用する際の限界を解消すること。
  • ポアソン分布や二項分布などの離散分布における分位数関数の非双対性および非微分可能性の問題を克服すること。
  • 解釈可能性と分布仮定を保持する、連続的でモデルに適合した分位数関数の補間を構築すること。
  • 離散データに対するベイズ分位数回帰において、適切な不確実性の評価を可能にし、分位数の交差を回避すること。
  • 生成分布を用いてリンク関数を再定義することで、一般化線形混合モデル(GLMM)フレームワークを分位数回帰に拡張すること。

提案手法

  • 真の潜在的離散分布(例:ポアソン分布、二項分布)に基づく連続的補間を提案し、モデルに適合した性質を確保する。
  • 離散分布の逆累積分布関数(CDF)を用いて連続的分位数プロキシを定義し、任意のジャイタリングを回避する。
  • 分布固有のリンク関数を用いて分位数を線形予測子にリンクさせることで、分位数回帰を一般化線形モデルに再定式化する。
  • 空間効果の条件付きマルコフ確率場(CAR)モデルにおいて、精度および混合パラメータにペナルティ付き複雑性(PC)事前分布を採用する。
  • R-INLAを用いて効率的なベイズ推論を実施し、不確実性評価のための完全な事後分布を活用する。
  • 病院入院データにこの手法を適用し、分位数特異の相対的リスクをモデル化し、超過確率を用いて高リスク地域を同定する。

実験結果

リサーチクエスチョン

  • RQ1離散分布に対して、有効な分位数回帰を可能にするため、連続的でモデルに適合した分位数関数の補間を構築できるか?
  • RQ2ジャイタリングや仮想尤度に依存せずに、離散データにおける分位数回帰で適切な不確実性の評価を達成する方法は何か?
  • RQ3提案手法が離散応答設定における分位数の交差をどの程度軽減できるか?
  • RQ4提案フレームワークは一般化線形混合モデル(GLMM)フレームワークに統合可能か?これにより、既存の尤度ベースのモデルと分位数回帰を統合できるか?
  • RQ5モデルに適合したアプローチは、点推定に基づく手法と比較して、疾患マッピングにおける高リスク地域の同定をどの程度改善するか?

主な発見

  • モデルに適合した補間により、ジャイタリングの欠点を回避する連続的で分布固有の分位数プロキシを構築することで、離散データに対する分位数回帰が有効に実現された。
  • 完全な事後分布推論を活用することで、不確実性の適切な評価が可能となり、超過確率の計算によって高リスク地域の同定が可能になった。
  • 真のデータ生成分布をモデル構造に組み込むことで、分位数の交差が緩和された。
  • 入院データの再分析において、劣位性は自己傷害発生率に一貫して否定的影響を及ぼすことが判明し、中央分位数における事後平均係数は1.981であった。
  • 地方居住状態は入院リスクを低くし、事後平均係数は-0.814であった。これは保護的効果を示している。
  • 第1四分位数の相対的リスクについて、超過確率(例:Pr(θ_i^0.25 > 1) > 0.95)を用いることで、点推定に基づく手法と比較して高リスク地域の同定が改善された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。