Skip to main content
QUICK REVIEW

[论文解读] Batch Stationary Distribution Estimation

Junfeng Wen, Bo Dai|arXiv (Cornell University)|Mar 2, 2020
Advanced Queuing Theory Analysis参考文献 50被引用 12
一句话总结

本文提出了一种变分幂法(VPM),用于在无法访问底层过程或探测分布的情况下,仅使用固定批次的转移数据,估计遍历马尔可夫链的平稳分布。VPM通过变分公式一致地估计平稳分布与探测分布之间的比值,从而在排队系统、随机微分方程(SDE)、MCMC后处理以及离策略评估中实现高精度的数据后处理,显著优于现有方法。

ABSTRACT

We consider the problem of approximating the stationary distribution of an ergodic Markov chain given a set of sampled transitions. Classical simulation-based approaches assume access to the underlying process so that trajectories of sufficient length can be gathered to approximate stationary sampling. Instead, we consider an alternative setting where a fixed set of transitions has been collected beforehand, by a separate, possibly unknown procedure. The goal is still to estimate properties of the stationary distribution, but without additional access to the underlying system. We propose a consistent estimator that is based on recovering a correction ratio function over the given data. In particular, we develop a variational power method (VPM) that provides provably consistent estimates under general conditions. In addition to unifying a number of existing approaches from different subfields, we also find that VPM yields significantly better estimates across a range of problems, including queueing, stochastic differential equations, post-processing MCMC, and off-policy evaluation.

研究动机与目标

  • 解决仅在拥有固定批次转移数据、且无法访问底层过程或探测分布时,估计平稳分布特性的挑战。
  • 开发一种无需模型的、一致的估计器,仅通过预收集的转移对恢复平稳分布。
  • 统一并改进现有在排队系统、随机微分方程、MCMC后处理和离策略评估中的方法。
  • 通过仅从行为策略数据中估计状态-动作对的平稳分布,实现与行为无关的离策略评估。

提出的方法

  • 提出对幂法的变分重构,以绕过原始幂迭代中难以处理的功能操作,从而实现平稳分布估计。
  • 通过变分优化目标估计平稳分布与探测分布之间的比值函数 τ(x) ≈ μ(x)/p(x)。
  • 使用神经网络或函数逼近器表示比值函数 τ(x),并通过强制满足马尔可夫链的不动点条件的变分目标进行训练。
  • 应用学习到的比值对收集到的状态的经验分布进行重加权,从而获得平稳分布的一致估计。
  • 采用两步流程:首先估计校正比值;其次,利用该比值计算平稳测度下的期望。
  • 证明VPM通过直接学习比值函数而非建模转移核,避免了基于模型方法常见的崩溃问题。

实验结果

研究问题

  • RQ1能否在不进行额外数据采集且未知探测分布的情况下,仅从固定批次的转移数据中构建平稳分布的一致估计器?
  • RQ2如何将幂法适配到批量、无模型的设置中,其中转移算子未知且功能操作难以处理?
  • RQ3与现有方法相比,所提出的变分幂法在排队系统、SDE、MCMC和离策略评估中能将估计精度提升多少?
  • RQ4当探测分布未知且数据由任意采样机制收集时,VPM方法是否仍保持鲁棒性和一致性?
  • RQ5VPM能否仅通过行为策略转移数据估计平稳状态-动作分布,从而实现与行为无关的离策略评估?

主要发现

  • 在所有测试领域(包括排队系统、SDE和MCMC)中,VPM在平稳分布估计方面显著优于基于模型的基线方法和重要性采样方法。
  • 在MCMC后处理中,VPM通过在不同MCMC步骤中持续提升重采样数据的质量,显著降低了估计样本与真实样本之间的最大均值差异(MMD)。
  • 在离策略评估中,VPM优于所有基线方法——包括Liu等人(2018)的无行为依赖方法和加权重要性采样——在Taxi、Reacher、HalfCheetah和Ant环境中均实现了更低的对数MSE。
  • 该方法通过直接学习比值函数,避免了基于模型方法常见的数据崩溃问题,从而在估计的平稳分布中保持了多样性和准确性。
  • 实证结果表明,MMD和MSE在多个数据集和设置下均表现出一致改进,证明了VPM的鲁棒性和泛化能力。
  • 理论分析证实,在一般条件下,即使缺乏对探测分布或转移核的了解,VPM仍能提供平稳分布的可证明一致估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。