Skip to main content
QUICK REVIEW

[论文解读] Multivariate Brenier cumulative distribution functions and their application to non-parametric testing

Melf Boeckel, Vladimir Spokoiny|arXiv (Cornell University)|Sep 11, 2018
Machine Learning and Algorithms参考文献 19被引用 15
一句话总结

本文通过循环单调最优传输映射引入多变量Brenier累积分布函数(ν-BDF),将单变量CDF推广至高维空间。通过将测度μ在紧致凸集N上推动至目标测度ν,该方法实现了基于2- Wasserstein距离的非参数两样本检验,实现了统一收敛性并提供了有限样本误差界。

ABSTRACT

In this work we introduce a novel approach of construction of multivariate cumulative distribution functions, based on cyclical-monotone mapping of an original measure $μ\in \mathcal{P}^{ac}_2(\mathbb{R}^d)$ to some target measure $ν\in \mathcal{P}^{ac}_2(\mathbb{R}^d)$ , supported on a convex compact subset of $\mathbb{R}^d$. This map is referred to as $ν$-Brenier distribution function ($ν$-BDF), whose counterpart under the one-dimensional setting $d = 1$ is an ordinary CDF, with $ν$ selected as $\mathcal{U}[0, 1]$, a uniform distribution on $[0, 1]$. Following one-dimensional frame-work, a multivariate analogue of Glivenko-Cantelli theorem is provided. A practical applicability of the theory is then illustrated by the development of a non-parametric pivotal two-sample test, that is rested on $2$-Wasserstein distance.

研究动机与目标

  • 解决缺乏自然的多变量累积分布函数(CDF)推广形式的问题,该形式可保持如统一收敛性等关键性质。
  • 为多变量数据开发一种非参数两样本检验方法,避免对基础分布施加限制性假设。
  • 基于循环单调性与最优传输理论,为多变量分布函数建立理论基础。
  • 在最小分布假设下,为非参数检验中的第一类与第二类错误提供有限样本误差界。

提出的方法

  • 将ν-Brenier分布函数(ν-BDF)定义为从μ的支撑集到ℝᵈ中紧致凸集N的循环单调映射F: supp(μ) → N,其中ν是N上的连续目标测度。
  • 利用Brenier的极分解定理,构造一个保持测度、循环单调的映射T,将μ推动至ν,从而保证几何保真性。
  • 为经验ν-BDF建立多变量Glivenko–Cantelli定理,证明经验过程对真实分布函数的统一收敛性。
  • 基于两个样本的经验ν-BDF之间的2-Wasserstein距离,构建一个枢轴两样本检验,使用从蒙特卡洛模拟中预先计算的临界值zₙₘ(α)。
  • 通过算法2计算临界值zₙₘ(α),该算法在单位球上生成独立同分布的均匀网格排列,以在原假设H₀下模拟零分布。
  • 通过固定均匀网格的分位数生成控制第一类错误,确保检验为枢轴检验且独立于样本分布。

实验结果

研究问题

  • RQ1如何构建一种多变量累积分布函数,使其在保持统一收敛性等关键统计性质的同时,推广单变量CDF?
  • RQ2通过循环单调映射的最优传输是否能提供一种几何上有意义且在统计上有效的多变量CDF框架?
  • RQ3基于2-Wasserstein距离的非参数两样本检验在多变量设置下的有限样本行为如何?
  • RQ4能否构建一种枢轴检验,使其在不依赖基础分布知识的情况下控制第一类错误?

主要发现

  • 所提出的ν-Brenier分布函数为CDF提供了一个有效的多变量推广形式,多变量Glivenko–Cantelli定理确保了经验过程的统一收敛性。
  • 基于经验ν-BDF之间2-Wasserstein距离的两样本检验具有枢轴性,第一类错误通过从固定均匀网格预计算临界值得到控制。
  • 第二类错误的上界为βₙₘ = ℙ(zₙₘ(α) ≥ Γₙₘ),其中Γₙₘ = Δ‖F⁻¹‖⁻¹_{L²(νₓ)} − (x/n)²/ᵈ − (x/m)²/ᵈ − r(n+m),每一项代表一种独立的误差来源。
  • 该方法具有渐近一致性:当样本量增加时,在备择假设(Δ > 0)下,第二类错误界βₙₘ衰减至零。
  • 在Vinho Verde葡萄酒数据集上的实验表明,质量等级为5、6、7的白葡萄酒与5、6的红葡萄酒在化学成分上存在统计显著差异,验证了检验的实证功效。
  • 实验结果验证了第二类错误收敛速率随样本量增加而提升,且在相同显著性水平(α = 0.95)下,红葡萄酒组的收敛速度高于白葡萄酒组。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。