Skip to main content
QUICK REVIEW

[論文レビュー] The graphical structure of respondent-driven sampling

Forrest W. Crawford|arXiv (Cornell University)|Jun 3, 2014
HIV, Drug Use, Sexual Risk参考文献 27被引用数 4
ひとこと要約

本稿は、応答者のネットワーク次数、紹介券の使用パターン、および応答者の募集タイミングを活用して、隠れた社会的ネットワーク構造を推定する連続時間確率モデルを提案する。募集を時間連続的プロセスとしてモデル化し、得られる部分グラフを指数型ランダムグラフとして扱うことで、計算的に効率的な基礎となるネットワークの推定が可能となり、シミュレーションによる検証およびロシア・サンクトペテルブルクにおける注射薬物使用者を対象としたRDS研究への応用が行われた。

ABSTRACT

Respondent-driven sampling (RDS) is a chain-referral method for sampling members of a hidden or hard-to-reach population such as sex workers, homeless people, or drug users via their social network. Most methodological work on RDS has focused on inference of population means under the assumption that subjects' network degree determines their probability of being sampled. Criticism of existing estimators is usually focused on missing data: the underlying network is only partially observed, so it is difficult to determine correct sampling probabilities. In this paper, we show that data collected in ordinary RDS studies contain information about the structure of the respondents' social network. We construct a continuous-time model of RDS recruitment that incorporates the time series of recruitment events, the pattern of coupon use, and the network degrees of sampled subjects. Together, the observed data and the recruitment model place a well-defined probability distribution on the recruitment-induced subgraph of respondents. We show that this distribution can be interpreted as an exponential random graph model and develop a computationally efficient method for estimating the hidden graph. We validate the method using simulated data and apply the technique to an RDS study of injection drug users in St. Petersburg, Russia.

研究の動機と目的

  • 既存のRDS推定手法が不完全なネットワークデータに依存し、サンプリング確率が単にネットワーク次数に依存すると仮定するという限界を是正すること。
  • 通常は欠損または観測不能と見なされるRDSデータから、隠れた社会的ネットワークの構造的情報を抽出する手法を開発すること。
  • 募集プロセスを時間連続的確率過程としてモデル化し、募集イベントの時系列、紹介券の使用、およびネットワーク次数を統合すること。
  • 指数型ランダムグラフモデルに基づく計算的に効率的なフレームワークを用いて、隠れたネットワーク構造を推定すること。
  • 特に募集イベントの待機時間分布の誤指定に対して、手法のロバストネスを検証すること。

提案手法

  • 各隠れたネットワークの辺が、独立に指数分布に従う待機時間を持つ連続時間マーカフ過程としてRDSの募集プロセスを定式化する。
  • 観察された募集時刻、次数、および紹介券使用に基づいて、募集によって誘発される部分グラフの構造に制約を課す「適合性条件」(定義4)を導入する。
  • 募集によって誘発される部分グラフを指数型ランダムグラフとしてモデル化し、辺の確率がレートパラメータλと感受性のある辺の数に依存するようにする。
  • 観察データから導かれた境界を用いて、事前分布の妥当性を保証するため、λにガンマ事前分布を用いるベイズ枠組みを採用する。
  • 隠れたグラフの事後分布からのサンプリングを可能にするために、メトロポリス・ハスティングス法を適用し、ネットワーク構造の推論を実現する。
  • 実データにおける観察された募集パターンと次数分布を用いて、事前分布のλをキャリブレーションするための経験的ベイズ手法を採用する。

実験結果

リサーチクエスチョン

  • RQ1RDSの募集プロセスは、時間的ダイナミクスとネットワーク構造を捉える連続時間確率過程としてモデル化可能か?
  • RQ2募集時刻、次数、および紹介券使用の部分観測から、どれだけの範囲で隠れた社会的ネットワーク構造を回復できるか?
  • RQ3募集の待機時間分布が誤って指定された場合、ネットワーク推定手法のロバストネスはどの程度保たれるか?
  • RQ4ネットワークトポロジーと時間的ダイナミクスを統合することで、本手法は既存のRDS推定手法を改善できるか?
  • RQ5本手法は、実世界のRDSデータにおいて、エッジ単位の募集レートλを正確に推定し、真のネットワークトポロジーを再構築できるか?

主な発見

  • 正しく指定された指数分布の待機時間のもとで、本手法は高い正確性(平均正確度0.974)で隠れたネットワーク構造を再構築できた。
  • 正しいモデル指定下で、真正陽性率(TPR)と真正陰性率(TNR)はそれぞれ0.974および0.990を維持し、良好なエッジ検出性能を示した。
  • 待機時間分布の誤指定(例:δ < 1 または δ > 1 のガンマ分布)下でも、部分グラフの再構築に関して本手法はロバストであるが、λの推定値にはバイアスが生じる:δ < 1 の場合に過大推定され、δ > 1 の場合に低めに推定される。
  • モデル誤指定下では推定されたエッジ単位の募集レートλがバイアスを示し、真のλ = 1から最大で0.10(δ = 0.1の場合)および0.01(δ = 0.01の場合)のずれが生じた。
  • サンクトペテルブルクのデータに基づき、9.8×10⁻⁴ から 4.2×10⁻² の範囲に制限された経験的ベイズ事前分布は、妥当かつ情報豊富な事前分布を保証した。
  • 本手法は、シミュレーションデータおよびロシア・サンクトペテルブルクにおける注射薬物使用者の実世界RDSデータの両方で、高い再構築正確度とλの安定した推定を示し、優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。