Skip to main content
QUICK REVIEW

[论文解读] Two-stage approaches to the analysis of occupancy data I: The homogeneous case

Natalie Karavarsamis, Richard Huggins|arXiv (Cornell University)|Mar 30, 2018
Spatial and Panel Data Analysis参考文献 10被引用 4
一句话总结

本文提出一种基于正交参数化和部分似然的两阶段推理方法,用于同质性占用模型,以简化最大似然估计。通过变换参数以确保检测概率与占用概率之间的正交性,该方法实现了基于条件似然和部分似然的独立估计,从而获得高效、可解析求解的估计量,计算负担极小,且与完整似然方法相比仅造成微小的效率损失。

ABSTRACT

Occupancy models are used in statistical ecology to estimate species dispersion. The two components of an occupancy model are the detection and occupancy probabilities, with the main interest being in the occupancy probabilities. We show that for the homogeneous occupancy model there is an orthogonal transformation of the parameters that gives a natural two-stage inference procedure based on a conditional likelihood. We then extend this to a partial likelihood that gives explicit estimators of the model parameters. By allowing the separate modelling of the detection and occupancy probabilities, the extension of the two-stage approach to more general models has the potential to simplify the computational routines used there.

研究动机与目标

  • 为简化占用模型中复杂的完整似然估计,该方法涉及对检测概率与占用概率的联合建模。
  • 降低具有大量协变量模型中的计算负担,因为完整似然在模型数量呈指数增长时变得不可行。
  • 开发一种两阶段推理程序,允许对检测概率与占用概率进行独立建模,从而提升计算的稳定性和效率。
  • 探索使用正交参数化与部分似然,推导出占用概率与检测概率的显式、可解析求解的估计量。

提出的方法

  • 对参数实施正交变换,定义 η = ψθ(检测到被占用站点的概率),并保留 p(每次调查的检测概率),使参数在渐近意义上相互独立。
  • 基于被占用站点的检测次数,使用条件似然估计 p,从而获得检测概率的二项分布似然。
  • 推导出一种部分似然,其可分解为 η 和 p 的两个独立二项分布似然,从而实现显式解析估计量。
  • 实施两阶段方法:首先通过条件似然估计 p,然后通过变换参数 η 估计 ψ,避免联合最大化。
  • 通过模拟和真实数据(蛙类检测数据)应用验证该方法,将效率与偏差与完整似然方法进行比较。
  • 使用 R 包 VGAM 实现条件似然方法,并与完整似然估计结果进行比较。

实验结果

研究问题

  • RQ1在同质性占用模型中,正交参数化是否能自然导出一种简化最大似然估计的两阶段推理程序?
  • RQ2与完整似然相比,部分似然方法在效率与计算可行性方面表现如何?
  • RQ3小检测概率与较少的调查次数对估计量偏差与标准误准确性有何影响?
  • RQ4在具有大量协变量的模型中,该两阶段方法是否能在显著降低计算复杂度的同时保持高效率?

主要发现

  • 参数 η = ψθ 与 p 的正交变换使最大似然估计量在渐近意义上相互独立,从而简化了推断并降低了计算复杂度。
  • 基于条件似然推导出的检测概率估计量 p 与标准二项分布估计量等价,便于直接实现。
  • 部分似然方法为 ψ 和 p 均提供了显式解析估计量,其中 ψ 的估计量相对完整似然的效率超过 90%。
  • 模拟结果显示两种方法均无显著偏差,且估计的标准误可靠,但当 p 和 τ 较小时存在轻微过度估计。
  • 在 27 个站点、τ=4 的真实数据应用中,部分似然得到 p̃=0.889 和 ψ̃=0.556,而完整似然得到 p̂=0.780 和 ψ̂=0.557,表明检测概率估计存在显著差异。
  • p 估计值的差异提示检测概率在不同调查时段可能存在异质性,因为部分似然忽略了完整似然中使用的首次访问信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。