[論文レビュー] Identification of homophily and preferential recruitment in respondent-driven sampling
本稿は、回答者駆動型サンプリング(RDS)における同質性(homophily)と好応募性(preferential recruitment)を厳密に定義し、観察されたネットワーク構造が不明な場合、RDSデータのみからこれらを点特定できないことを示している。非パラメトリックな同定領域と確率的最適化を用いて、RDS研究における同質性や応募バイアスに関する実証的主張は、追加のネットワークデータがなければ統計的に信頼できないことを示している。
Respondent-driven sampling (RDS) is a link-tracing procedure for surveying hidden or hard-to-reach populations in which subjects recruit other subjects via their social network. There is significant research interest in detecting clustering or dependence of epidemiological traits in networks, but researchers disagree about whether data from RDS studies can reveal it. Two distinct mechanisms account for dependence in traits of recruiters and recruitees in an RDS study: homophily, the tendency for individuals to share social ties with others exhibiting similar characteristics, and preferential recruitment, in which recruiters do not recruit uniformly at random from their available alters. The different effects of network homophily and preferential recruitment in RDS studies have been a source of confusion in methodological research on RDS, and in empirical studies of the social context of health risk in hidden populations. In this paper, we give rigorous definitions of homophily and preferential recruitment and show that neither can be measured precisely in general RDS studies. We derive nonparametric identification regions for homophily and preferential recruitment and show that these parameters are not point identified unless the network takes a degenerate form. The results indicate that claims of homophily or recruitment bias measured from empirical RDS studies may not be credible. We apply our identification results to a study involving both a network census and RDS on a population of injection drug users in Hartford, CT.
研究の動機と目的
- RDSにおける同質性と好応募性の異なるメカニズムを明確にし、これらがしばしば方法論的および実証的研究で混同されていることに対処すること。
- 観察されていないネットワークエッジの存在により、標準的なRDSデータから同質性や好応募性を点同定できないことを示すこと。
- 一般RDS条件下におけるこれらの2つのパラメータの非パラメトリック同定領域を導出すること。
- ハーフォード(コネチカット州)の実世界データセットを用いて、RDS研究における同質性や応募バイアスに関する実証的主張の信頼性を評価すること。
- 疫学的特性のネットワークレベルでのクラスタリングを検出するRDSの限界を理論的に裏付ける基盤を提供すること。
提案手法
- 著者らは、同質性を、類似した特徴を持つ個体が社会的つながりを形成する傾向として定義し、好応募性をネットワークの隣人から非一様に被験者を選抜する行動として定義する。
- 問題を非パラメトリック同定の課題として形式化し、同じRDSデータを生じさせる複数の観察されないネットワーク構成が存在しうることを示す。
- 確率的最適化とマルコフ連鎖モンテカルロ(MCMC)サンプリングを用いて、整合可能な拡張部分グラフおよび特徴集合の空間を探索し、同定領域を推定する。
- 2段階のMCMC提案機構を提案する:(1) 頂点の追加・削除に加え頂点の創出、(2) 観察されていない頂点の特徴値の入れ替え。
- この手法は、Hajek(1988)の冷却スケジュールと収束基準に依存しており、MCMC系列が適合関数のグローバル最大値に漸近的に収束することを保証する。
- 同定領域は、観察されたRDSデータと応募度数と整合するすべての可能なネットワークおよび特徴構成の集合を探索することで導出される。
実験結果
リサーチクエスチョン
- RQ1観察されたRDSデータのみから、潜在的な社会的ネットワークにおける同質性を点同定できるか?
- RQ2完全なネットワーク構造を観察しない限り、RDSにおける好忦募行動を正確に測定できるか?
- RQ3RDS研究における同質性や応募バイアスに関する実証的主張が、検証不能な仮定に依存する程度はどの程度か?
- RQ4一般RDS条件下における同質性および好応募性の非パラメトリック同定領域は何か?
- RQ5理論的な同定限界は、公衆衛生および疫学的モデルにおけるRDSデータの解釈にどのように影響を与えるか?
主な発見
- 同質性と好応募性は、一般RDS研究では点同定不可能である。なぜなら、複数の観察されないネットワーク構成が同じ観察された応募データを生じさせうるからである。
- 両パラメータの同定領域は非退化である。これは、完全なRDSデータが得られても、追加のネットワーク情報がなければ同質性や応募バイアスの正確な測定が不可能であることを意味する。
- 著者らは、特定の冷却スケジュールのもとで、MCMC系列が適合関数のグローバル最大値に収束する確率が1に近づくことを証明しており、これにより正しい同定領域への漸近的収束が保証される。
- ハーフォード(コネチカット州)の注射薬使用者集団を対象とした実世界応用において、同質性および好応募性の同定領域は広く、実証的推定値の精度が限定的であることが示された。
- 本研究は、RDSデータのみに依拠した同質性や応募バイアスの主張は、外部のネットワークデータがなければ統計的に信頼できないと結論づける。
- 結果として、RDSデータを用いて伝染病拡散モデルにおける非一様混合やネットワーククラスタリングを推定することは、有効性に疑問が呈される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。