[논문 리뷰] Using a Birth-Death Process to Account for Reporting Errors in Longitudinal Self-reported Counts of Behavior
이 논문은 HIV 양성 청소년의 성관계 파artner 수를 장기적으로 자가 보고한 횟수의 보고 오류를 교정하기 위해 선형 출생-사멸 과정과 포아송 랜덤 효과 모델을 통합한 베이지안 계층 모델을 제안한다. 보고된 횟수를 관측되지 않은 진짜 횟수의 노이즈 있는 관측값으로 모델링함으로써, 기억 오류를 무시하는 기존 포아송 모델에 비해 특히 고빈도 보고에 대해 추론 정확도를 향상시킨다.
We analyze longitudinal self-reported counts of sexual partners from youth living with HIV. In self-reported survey data, subjects recall counts of events or behaviors such as the number of sexual partners or the number of drug uses in the past three months. Subjects with small counts may report the exact number, whereas subjects with large counts may have difficulty recalling the exact number. Thus, self-reported counts are noisy, and mis-reporting induces errors in the count variable. As a naive method for analyzing self-reported counts, the Poisson random effects model treats the observed counts as true counts and reporting errors in the outcome variable are ignored. Inferences are therefore based on incorrect information and may lead to conclusions unsupported by the data. We describe a Bayesian model for analyzing longitudinal self-reported count data that formally accounts for reporting error. We model reported counts conditional on underlying true counts using a linear birth-death process and use a Poisson random effects model to model the underlying true counts. A regression version of our model can identify characteristics of subjects with greater or lesser reporting error. We demonstrate several approaches to prior specification.
연구 동기 및 목표
- 자기 보고한 장기적 행동 횟수에서 기억 오류 문제를 다루기 위해, 특히 고빈도 행동에 대해.
- 진짜 기저 횟수와 기억 및 보고 편향이 있는 보고된 획수를 구분할 수 있는 통계 모델을 개발하기 위해.
- 보고 오류를 공식적으로 고려함으로써, 보고된 값이 정확하다고 가정하는 것보다 공중보건 연구에서의 추론을 향상시키기 위해.
- 모델의 회귀 확장으로 인해 개인 수준의 예측 변수를 특정하여 보고 오류가 더 크거나 더 작은 경우를 식별할 수 있도록 하기 위해.
- 적절한 사전 분포와 MCMC 샘플링을 갖춘 민감한 베이지안 프레임워크를 제공하기 위해.
제안 방법
- 관측된 자가 보고 횟수 $Y_{ij}$ 를 관측되지 않은 진짜 횟수 $Z_{ij}$ 를 조건으로 하여 선형 출생-사멸(BD) 과정을 사용해 조건부 분포로 모델링하며, 비율 매개변수 $\lambda_{ij}$ 를 포함한다.
- 진짜 횟수 $Z_{ij}$ 를 모델링하기 위해 포아송 랜덤 효과 모델(PREM)을 사용하며, 개인별 랜덤 절편 $\epsilon_i$ 와 공변량을 포함한다.
- 계층 베이지안 프레임워크에서 $\lambda_{ij} = \exp(\mathbf{w}_{ij}^\top \boldsymbol{\psi} + \epsilon_i)$ 를 사용하여 BD 과정을 공변량에 대한 로그 비율에 대한 회귀로 연결한다.
- 잠재된 진짜 횟수 $Z_{ij}$ 를 추정하기 위해 메트로폴리스-한팅스 MCMC 샘플링을 적용하며, 유효한 정수 전이를 보장하기 위해 상태 의존성 제안 분포를 사용한다.
- 분산 성분에 대해 공액 사전 분포를 사용하며, 예를 들어 $D_\epsilon^{-1}$ 에 대해 역감마 사전 분포를 사용하고, 회귀 계수에 대해서는 희박하거나 약한 정보를 갖는 사전 분포를 사용한다.
- 큰 $Z_{ij}$ 에 대해 로그 감마 보정을 포함하여, BD 우도와 PREM 우도를 결합하여 공동 사후 밀도를 유도한다.
실험 결과
연구 질문
- RQ1자기 보고한 성관계 파artner 수에서 보고 오류를 고려할 경우, 장기적 행동 연구에서의 추론에 어떤 영향을 미치는가?
- RQ2보고 오류는 진짜 횟수의 크기와 어떻게 다를 수 있으며, 이를 확률적으로 모델링할 수 있는가?
- RQ3출생-사멸 과정이 자가 보고 행동 횟수의 기억 오류의 확률적 동역학을 효과적으로 포괄할 수 있는가?
- RQ4어떤 개인 수준의 특성이 더 높거나 낮은 보고 오류와 관련이 있으며, 이를 어떻게 추정할 수 있는가?
- RQ5제안된 모델은 표준 포아송 랜덤 효과 모델에 비해 편향과 정밀도 측면에서 어떻게 비교되는가?
주요 결과
- 보고된 획수를 관측되지 않은 진짜 획수의 노이즈 있는 관측값으로 간주함으로써 모델이 보고 오류를 성공적으로 보정하여, 모수 추정치의 편향을 감소시켰다.
- 출생-사멸 과정은 특히 고빈도 수치에서 과대 또는 과소 보고의 확률을 모델링하는 민감한 확률적 메커니즘을 제공한다.
- 진짜 횟수 모델에 개인별 랜덤 효과를 포함시켜 관측되지 않은 이질성과 시간대 간 상관관계를 포착한다.
- 모델의 회귀 확장은 보고 오류와 관련된 공변량을 식별하여 높은 오류를 보이는 군집을 식별할 수 있게 한다.
- 상태 의존성 제안을 사용한 메트로폴리스-한팅스를 통한 사후 샘플링은 정수 값의 잠재 횟수 공간을 유효하게 탐색한다.
- 오류가 많은 데이터에 기반한 추론을 피하는 바람에, 모델이 단순 포아송 모델보다 성능이 뛰어나다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.