Skip to main content
QUICK REVIEW

[论文解读] Priority-Aware Shapley Value

Kiljae Lee, Ziqi Liu|arXiv (Cornell University)|Feb 10, 2026
Data Quality and Management被引用 0
一句话总结

PASV 将硬先序约束与软的贡献者优先权重相结合,产生结构保持的数据估值与特征归因,具可扩展的蒙特卡洛估计与名为优先权扫掠的敏感性工具。

ABSTRACT

Shapley values are widely used for model-agnostic data valuation and feature attribution, yet they implicitly assume contributors are interchangeable. This can be problematic when contributors are dependent (e.g., reused/augmented data or causal feature orderings) or when contributions should be adjusted by factors such as trust or risk. We propose Priority-Aware Shapley Value (PASV), which incorporates both hard precedence constraints and soft, contributor-specific priority weights. PASV is applicable to general precedence structures, recovers precedence-only and weight-only Shapley variants as special cases, and is uniquely characterized by natural axioms. We develop an efficient adjacent-swap Metropolis-Hastings sampler for scalable Monte Carlo estimation and analyze limiting regimes induced by extreme priority weights. Experiments on data valuation (MNIST/CIFAR10) and feature attribution (Census Income) demonstrate more structure-faithful allocations and a practical sensitivity analysis via our proposed "priority sweeping".

研究动机与目标

  • 说明需要尊重贡献者之间的依赖性与先序关系的估值方法。
  • 定义一种统一的 Shapley 类型值,将硬先序约束与软的、贡献者特定的优先级结合起来。
  • 开发基于 MCMC 的可扩展估算器,用于在非均匀权重下对具有先序约束的排序进行抽样。
  • 提供公理化表征,唯一识别 PASV,并解释在极端优先级下的极限情形。
  • 提供一个实用的诊断工具(优先权扫掠)用于对估值的鲁棒性分析。

提出的方法

  • 将 PASV 表述为一个遵循一般先序与权重的随机顺序值 p^(preceq, lambda) 的形式。
  • 证明当所有权重相等时,PASV 收敛到 PSV;在有序分区的 DAG 下收敛到 WSV。
  • 提供一个 SCF(状态–选择因子分解)表示,以在先序约束下实现 Plackett–Luce 风格的采样。
  • 开发一个相邻交换的 Metropolis–Hastings 采样器,以高效近似 PASV 分布。
  • 推导关于极端权重会转化为修改后的先序结构的极限情形的理论结果。
  • 引入优先权扫掠作为诊断工具,用于评估权重对估值的敏感性。
Figure 5 : MNIST results. Top: Provider-level values (summed value for each provider (Lee et al. , 2025 ) ; $10$ repetitions, report mean & $\pm 1$ std. bars; Middle: Marginal contributions: $\mathbb{E}[U(\pi^{i}\cup\{i\})-U(\pi^{i})||\pi^{i}|=s]$ vs $s$ , c.f. ( 1 ), $p:=$ Uniform $(\Pi^{\preceq})$
Figure 5 : MNIST results. Top: Provider-level values (summed value for each provider (Lee et al. , 2025 ) ; $10$ repetitions, report mean & $\pm 1$ std. bars; Middle: Marginal contributions: $\mathbb{E}[U(\pi^{i}\cup\{i\})-U(\pi^{i})||\pi^{i}|=s]$ vs $s$ , c.f. ( 1 ), $p:=$ Uniform $(\Pi^{\preceq})$

实验结果

研究问题

  • RQ1Shapley 类型的归因如何同时结合硬先序约束和软的逐玩家优先级?
  • RQ2PASV 是否统一现有的基于先序和基于权重的 Shapley 变体,并在何种条件下这些简化是精确的?
  • RQ3如何在具有一般有向无环图(DAG)的玩家大集合中高效计算 PASV?
  • RQ4极端优先级权重对底层先序结构的极限影响是什么?
  • RQ5PASV 是否能提供可操作的数据估值与特征归因的敏感性分析?

主要发现

  • PASV 提供一个统一的关于先序可行排序的分布,将硬先序与软优先权重结合在一起。
  • 当所有权重相等时,PASV 收敛到 PSV;对于有序分区的 DAG,收敛到 WSV。
  • SCF 形式支持可扩展的蒙特卡洛估计,并保留权重作为软优先级的可解释性。
  • 相邻交换的 Metropolis–Hastings 采样器实现了对 PASV 分布的高效采样。
  • 极端权重会通过论文分析的极限行为,对先序结构产生有效的改变,而不改变原始 DAG。
  • 在数据估值(MNIST/CIFAR10)和特征归因(Census Income)上的实验显示出更具结构保持性的分配以及通过优先权扫掠实现的实用敏感性分析。
(a) Ordered Partition
(a) Ordered Partition

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。