Skip to main content
QUICK REVIEW

[论文解读] Practical Adversarial Multivalid Conformal Prediction

Osbert Bastani, Varun Gupta|arXiv (Cornell University)|Jun 2, 2022
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出MVP(多校验预测),一种计算高效的近似校准预测方法,可实现对抗性多校验覆盖——确保不仅在边缘上,而且在阈值和任意可能重叠的特征子集上均保持正确的经验覆盖——且无需预留校准集。该方法在阈值校准和预测集信息量方面优于先前方法,尤其在分布偏移情况下表现更优。

ABSTRACT

We give a simple, generic conformal prediction method for sequential prediction that achieves target empirical coverage guarantees against adversarially chosen data. It is computationally lightweight -- comparable to split conformal prediction -- but does not require having a held-out validation set, and so all data can be used for training models from which to derive a conformal score. It gives stronger than marginal coverage guarantees in two ways. First, it gives threshold calibrated prediction sets that have correct empirical coverage even conditional on the threshold used to form the prediction set from the conformal score. Second, the user can specify an arbitrary collection of subsets of the feature space -- possibly intersecting -- and the coverage guarantees also hold conditional on membership in each of these subsets. We call our algorithm MVP, short for MultiValid Prediction. We give both theory and an extensive set of empirical evaluations.

研究动机与目标

  • 开发一种近似校准预测方法,可在对抗性数据序列下保持准确的经验覆盖,无需假设交换性或预留校准集。
  • 确保覆盖保证不仅在边缘上成立,同时在所用预测阈值和任意可能相交的特征子集(分组)上也成立。
  • 设计一种计算轻量、可扩展的方法,可作为包装器应用于任意预训练模型,适用于分类与回归任务。
  • 实现强于仅边缘覆盖的统计保证,避免通过极端预测集操纵覆盖的无信息“作弊”策略。

提出的方法

  • MVP使用动态阈值机制,实时适应校准得分,同时在所有阈值和分组上维持经验覆盖。
  • 通过维护每个阈值与分组组合的覆盖失败累计计数,实现实时调整阈值以达到目标覆盖率。
  • 将校准得分范围离散化为m个校准桶(例如m=40),跟踪每个桶内的覆盖情况,以确保多校验保证。
  • 支持在特征空间上定义的任意非互斥分组,允许对人口统计、临床或其他用户指定子集实现条件覆盖。
  • 无需单独的训练与校准数据,所有数据均可用于模型训练,与分割校准预测不同。
  • 通过确保对每个阈值q,当q_t = q时y_t被覆盖的频率收敛至1−δ,实现阈值校准。

实验结果

研究问题

  • RQ1是否存在一种近似校准预测方法,可在无需预留校准集的情况下,同时实现对阈值和任意特征子集的多校验覆盖?
  • RQ2在标准近似校准预测失效的对抗性或非交换性序列数据设置下,该方法表现如何?
  • RQ3该方法在多大程度上避免了通过极端预测集操纵覆盖的无信息预测策略?
  • RQ4在实践中,与现有最先进近似校准预测方法相比,该方法在预测集大小和覆盖准确性方面表现如何?

主要发现

  • 在30,000张ImageNet验证集上,MVP实现边缘覆盖率为0.902133,与RAPS的0.90523相当,表明在独立同分布设置下具有竞争力。
  • 尽管边缘覆盖率相近,MVP的平均预测集大小(2.13986)仅略高于RAPS的(2.0506),表明其具有出色的实用性效率。
  • 在合成递增得分序列中,MVP的平均预测集宽度为0.526,而ACI为1.839,表明MVP生成的区间显著更具信息量。
  • ACI的阈值几乎始终处于最大值(1),表明其频繁使用平凡预测集;而MVP的阈值紧密跟踪实际得分序列,确保了阈值校准。
  • MVP的阈值稳定且具信息量,避免了ACI表现出的‘作弊’策略——即在大多数轮次中预测完整集合。
  • 该方法在对抗性数据序列下保持多校验覆盖,对任意分布偏移(包括时间序列和非交换性数据)具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。