[论文解读] A Sample Complexity Measure with Applications to Learning Optimal Auctions
本文引入了分样本增长速率这一新的样本复杂度度量,简化了最优拍卖学习的分析。通过证明期望泛化误差被有界于 $ O\left(\sqrt{\frac{\log(\hat{\tau}_H(2m))}{m}}\right) $,该方法为 truthful 拍卖类提供了更紧致、更直观的样本复杂度界——特别是对于 ERM 输出仅依赖于样本值的拍卖类——而无需依赖伪维数或压缩界。
We introduce a new sample complexity measure, which we refer to as split-sample growth rate. For any hypothesis $H$ and for any sample $S$ of size $m$, the split-sample growth rate $\hatτ_H(m)$ counts how many different hypotheses can empirical risk minimization output on any sub-sample of $S$ of size $m/2$. We show that the expected generalization error is upper bounded by $O\left(\sqrt{\frac{\log(\hatτ_H(2m))}{m}} ight)$. Our result is enabled by a strengthening of the Rademacher complexity analysis of the expected generalization error. We show that this sample complexity measure, greatly simplifies the analysis of the sample complexity of optimal auction design, for many auction classes studied in the literature. Their sample complexity can be derived solely by noticing that in these auction classes, ERM on any sample or sub-sample will pick parameters that are equal to one of the points in the sample.
研究动机与目标
- 开发一种新的样本复杂度度量,以简化最优拍卖学习中泛化误差的分析。
- 为跨多样化 truthful 拍卖类推导样本复杂度界提供统一框架。
- 用基于子样本上经验风险最小化的更简单、更直观的度量,替代伪维数和压缩界等复杂工具。
- 为常见拍卖形式(如单品定价、组合定价及其组合)实现更紧致的样本复杂度界。
- 证明分样本增长速率能够捕捉到 ERM 参数被限制为样本值的拍卖类的本质复杂度。
提出的方法
- 引入分样本假设空间 $ \hat{H}_S $,定义为从大小为 $ m $ 的样本 $ S $ 中任意大小为 $ \lceil m/2 \rceil $ 的子样本上,ERM 输出的所有假设的集合。
- 定义分样本增长速率 $ \hat{\tau}_H(m) = \sup_S |\hat{H}_S| $,用于衡量 ERM 在任意大小为 $ m/2 $ 的子样本上可生成的不同假设的最大数量。
- 建立泛化误差界:$ \mathbb{E}[\textsc{R}_D(h_S)] \geq \sup_h \textsc{R}_D(h) - O\left(\sqrt{\frac{\log(\hat{\tau}_H(2m))}{m}}\right) $。
- 将该度量应用于 ERM 参数(如保留价、阈值)必须等于样本值之一的拍卖类,从而得到 $ \hat{\tau}_H(m) $ 的多项式界。
- 利用该界推导出虚拟福利拍卖的样本复杂度 $ m_H(\epsilon) = O\left(\frac{n \log(1/\epsilon)}{\epsilon^3}\right) $,以及单品和组合定价的样本复杂度 $ O\left(\frac{nk \log(1/\epsilon)}{\epsilon^2}\right) $。
- 证明该方法消除了基于伪维数的先前分析中出现的对数因子,从而得到更简洁、更紧致的界。
实验结果
研究问题
- RQ1能否开发一种新的样本复杂度度量,以简化最优拍卖学习中泛化误差的分析?
- RQ2分样本增长速率是否能提供比伪维数或 Rademacher 复杂度等现有工具更紧致、更直观的样本复杂度界?
- RQ3对于 ERM 输出仅依赖于样本值的拍卖类,分样本增长速率能否用于推导显式的样本复杂度界?
- RQ4该新度量能否消除传统复杂度度量带来的样本复杂度界中的对数因子?
- RQ5在边界 truthful 拍卖机制的泛化误差方面,分样本增长速率与先前方法相比在有效性上如何?
主要发现
- 期望泛化误差被有界于 $ O\left(\sqrt{\frac{\log(\hat{\tau}_H(2m))}{m}}\right) $,为学习性能提供了简洁、通用的界。
- 对于具有 $ \epsilon $-网格阈值的 $ t $-级虚拟福利拍卖,$ \hat{\tau}_H(m) \leq m^{n/\epsilon} $,从而得到样本复杂度 $ m_H(\epsilon) = O\left(\frac{n \log(1/\epsilon)}{\epsilon^3}\right) $。
- 对于具有 $ k $ 项和 $ n $ 位投标人的加法估值下的匿名保留价定价,$ \hat{\tau}_H(m) = m \cdot n $,从而得到样本复杂度 $ O\left(\frac{n \log(1/\epsilon)}{\epsilon^2}\right) $。
- 对于非匿名保留价定价,$ \hat{\tau}_H(m) \leq m^{n} $,样本复杂度仍为 $ O\left(\frac{n \log(1/\epsilon)}{\epsilon^2}\right) $。
- 对于组合组合与单品定价的结合,$ \hat{\tau}_H(m) \leq m^{n(k+1)} $,样本复杂度为 $ O\left(\frac{n(k+1) \log(1/\epsilon)}{\epsilon^2}\right) $。
- 该方法消除了先前基于伪维数的界中出现的 $ \log(nk) $ 因子,从而得到更简洁、更紧致的样本复杂度估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。