[论文解读] Anytime-Valid Inference for Multinomial Count Data
本文提出了一种针对多项计数数据的任意时间有效推断框架,利用置信序列和序贯检验,在可选停止和连续监控下保持第一类错误控制。该框架支持对非时齐伯努利过程和泊松过程的实时假设检验与估计——这对在线实验至关重要——通过构建概率向量、对数概率对比和强度比的置信序列,已在转化率测试和软件金丝雀监控等场景中得到验证。
Many experiments are concerned with the comparison of counts between treatment groups. Examples include the number of successful signups in conversion rate experiments, or the number of errors produced by software versions in canary experiments. Observations typically arrive in data streams and practitioners wish to continuously monitor their experiments, sequentially testing hypotheses while maintaining Type I error probabilities under optional stopping and continuation. These goals are frequently complicated in practice by non-stationary time dynamics. We provide practical solutions through sequential tests of multinomial hypotheses, hypotheses about many inhomogeneous Bernoulli processes and hypotheses about many time-inhomogeneous Poisson counting processes. For estimation, we further provide confidence sequences for multinomial probability vectors, all contrasts among probabilities of inhomogeneous Bernoulli processes and all contrasts among intensities of time-inhomogeneous Poisson counting processes. Together, these provide an "anytime-valid" inference framework for a wide variety of experiments dealing with count outcomes, which we illustrate with a number of industry applications.
研究动机与目标
- 解决在非平稳、时变条件下,对在线实验中计数数据维持有效统计推断的挑战。
- 通过支持连续监控和基于数据的停止策略,克服固定样本量检验的局限性,同时避免第一类错误率膨胀。
- 为常见于A/B测试和系统监控的多项分布、非时齐伯努利过程以及时变泊松过程提供实用的序贯推断工具。
- 构建概率向量及对数概率和对数强度中对比的置信序列,以支持灵活的实时假设检验。
- 在实际应用中展示该框架的实用性,例如样本比例不匹配检测、转化率优化和软件金丝雀测试。
提出的方法
- 采用混合鞅方法构建多项概率向量的置信序列,确保任意时间点的有效覆盖。
- 仅基于观测到的成功次数,推导用于多个非时齐伯努利过程相等性的序贯检验,无需失败事件的观测。
- 通过构建强度比和对数强度对比的置信序列,将框架扩展至时变泊松过程。
- 以多项置信序列为基石,构建所有成对及一般对比的联合置信序列。
- 通过似然比统计量开发序贯p值,其在可选停止和继续条件下仍保持有效性。
- 利用凸优化高效计算置信序列,实现在流数据环境中的实时应用。
实验结果
研究问题
- RQ1当观测值按顺序到达且成功概率随时间变化时,如何在在线实验中对计数数据维持有效的统计推断?
- RQ2能否为多项参数及对数概率中的对比构建在可选停止和连续监控下仍有效的置信序列?
- RQ3当仅能观测到成功事件而失败事件不可见时,非时齐伯努利过程的序贯检验在实践中可应用到何种程度?
- RQ4如何利用时变泊松过程中强度比的置信序列实现实时系统监控中的异常检测?
- RQ5所提出的框架在现实世界在线实验场景(如转化率优化和软件金丝雀测试)中,是否可在对数据平稳性假设极少的前提下应用?
主要发现
- 多项概率向量的置信序列在任意停止时间均保持有效覆盖,支持任意时间有效推断且不引起第一类错误膨胀。
- 非时齐伯努利过程的序贯检验即使在成功概率随时间变化时,也能检测到转化率差异,且无需观测失败事件。
- 在软件金丝雀测试中,强度比 $\lambda_1(t)/\lambda_0(t)$ 的置信序列在不到一秒内降至1.0以下,实现了对关键缺陷的快速检测。
- 由于联合置信序列的构建,该框架支持对所有组间对比的同步推断,无需多重检验校正。
- 序贯p值在可选停止和继续条件下仍保持有效性,支持自动化的、无需人工干预的实验终止并附带统计保证。
- 与固定样本量方法相比,该方法显著缩短了实验时长并减少了资源消耗,从而加快了实验与创新的节奏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。