Skip to main content
QUICK REVIEW

[论文解读] Online Social Welfare Function-based Resource Allocation

Kanad Pardeshi, Samsara Foubert|arXiv (Cornell University)|Feb 1, 2026
Advanced Bandit Algorithms Research被引用 0
一句话总结

该论文在固定人群上使用社会福利函数(SWF)形式化在线资源分配,提出置信序列框架以及结合近最优后悔界的SWF-UCB算法,覆盖三类SWF族(加权幂均值、Kolm、Gini)并给出近乎最优的后悔界。

ABSTRACT

In many real-world settings, a centralized decision-maker must repeatedly allocate finite resources to a population over multiple time steps. Individuals who receive a resource derive some stochastic utility; to characterize the population-level effects of an allocation, the expected individual utilities are then aggregated using a social welfare function (SWF). We formalize this setting and present a general confidence sequence framework for SWF-based online learning and inference, valid for any monotonic, concave, and Lipschitz-continuous SWF. Our key insight is that monotonicity alone suffices to lift confidence sequences from individual utilities to anytime-valid bounds on optimal welfare. Building on this foundation, we propose SWF-UCB, a SWF-agnostic online learning algorithm that achieves near-optimal $ ilde{O}(n+\sqrt{nkT})$ regret (for $k$ resources distributed among $n$ individuals at each of $T$ time steps). We instantiate our framework on three normatively distinct SWF families: Weighted Power Mean, Kolm, and Gini, providing bespoke oracle algorithms for each. Experiments confirm $\sqrt{T}$ scaling and reveal rich interactions between $k$ and SWF parameters. This framework naturally supports inference applications such as sequential hypothesis testing, optimal stopping, and policy evaluation.

研究动机与目标

  • 以SWF为聚合方式 formalize 对群体的重复资源分配。
  • 开发时间一致的置信序列框架,仅需要 SWF 的单调性。
  • 提供高效的在线学习算法并对 SWF 基于福利的最大化给出后悔保证。
  • 为三个 SWF 家族(Weighted Power Mean、Kolm、Gini)实例化框架并给出定制的 oracle。
  • 实现序贯检验、最优停止、策略评估等推断任务。

提出的方法

  • 定义 ex-ante utility _i = [U_i] 与策略 p,满足 sum(p_i)=k,通过 M(a mu a o p) 进行聚合。
  • 证明一个置信序列提升定理:单调的 SWF 允许将个体均值的坐标级 CS 转换为对 M(a mu a o p^*) 的任何时刻有效界限。
  • 开发 SWF-UCB:一个通用在线学习算法,利用上置信界(UCB)来优化 M(a mu a o p)。
  • 为每个 SWF 家族提供精确的策略优化 oracle(WPM、通过水位填充实现 Kolm;Gini 通过贪心区块方法实现)。
  • 使用相关抽样实现分配以满足基数和边际概率约束。
  • 给出后悔界:N=个体数,k 为每轮资源,T 轮:tilde{O}(n + sqrt(n k T))。
  • 展示在 k 和回报之间存在非单调的后悔,并讨论由 CS 框架支持的推断应用。
(a) WPM SWF
(a) WPM SWF

实验结果

研究问题

  • RQ1如何利用单调的 SWF 在在线资源分配中获得 anytime-valid 的福利保证?
  • RQ2在有界反馈条件下,基于 SWF 的在线分配的紧致后悔表现如何?
  • RQ3在在线设置中如何高效地为不同 SWF 家族(WPM、Kolm、Gini)优化分配?
  • RQ4该框架能否支持序贯推断任务如检验、停止和策略评估?
  • RQ5SWF 参数(权重、公平性参数 q)如何影响学习动态和后悔?

主要发现

  • SWF 单调性足以将坐标级 CS 提升为 anytime-valid 的福利界限(定理 4.1)。
  • SWF-UCB 在 n 个个体、T 轮中分配 k 资源时实现接近最优的 tilde{O}(n + sqrt(n k T)) 后悔。
  • 对 WPM 和 Kolm,利用水位填充可在 O(n log n) 的时间内提供精确 oracle;对 Gini 通过贪心区块方法在 O(k n) 实现。
  • 实验表明在 WPM、Kolm、Gini 下后悔呈 sqrt{T} 脚本缩放,且对 k 呈现非单调依赖(在中等的 k 处达到最高后悔)。
  • 中等程度的 SWF 参数带来更丰富的学习动态,且该框架支持序贯推断任务(如序贯检验、最优停止、策略评估)。
(b) Kolm SWF
(b) Kolm SWF

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。