[论文解读] Fairness with Continuous Optimal Transport
该论文提出了一种基于连续最优传输(COT)的随机梯度公平性方法,采用对偶公式以提升机器学习中的公平性。在数据有限的情况下,其性能优于离散OT方法,并能在实际部署中持续适应不断变化的不公平水平,展现出在动态数据条件下优越且稳定的性能。
Whilst optimal transport (OT) is increasingly being recognized as a powerful and flexible approach for dealing with fairness issues, current OT fairness methods are confined to the use of discrete OT. In this paper, we leverage recent advances from the OT literature to introduce a stochastic-gradient fairness method based on a dual formulation of continuous OT. We show that this method gives superior performance to discrete OT methods when little data is available to solve the OT problem, and similar performance otherwise. We also show that both continuous and discrete OT methods are able to continually adjust the model parameters to adapt to different levels of unfairness that might occur in real-world applications of ML systems.
研究动机与目标
- 解决离散最优传输(OT)在公平性感知机器学习中,特别是在数据稀缺条件下的局限性。
- 开发一种基于连续OT的方法,实现实时、动态地根据不公平水平的变化调整模型参数。
- 证明连续OT能够在保持高公平性-准确率权衡的同时,相比离散OT具有更高的数据效率。
- 展示该方法可在无需从头开始重新训练的情况下,对模型进行事后调整以适应不同的不公平水平。
- 验证该方法在现实世界机器学习系统中面对数据分布变化时的鲁棒性与适应性。
提出的方法
- 该方法采用连续最优传输(COT)的对偶公式,直接在模型输出的连续分布上计算公平性约束。
- 通过使用随机梯度下降优化模型参数,同时利用OT距离强制敏感属性与模型预测之间的统计独立性。
- 该方法避免对分布进行离散化,从而在低数据场景下实现更精确、更稳定的运输成本估计。
- 在OT公式中的对偶变量通过迭代方式更新,以引导模型参数向更公平的输出分布靠拢。
- 该方法设计为兼容分类和回归任务,并可扩展至除人口统计均等性之外的其他公平性标准。
- 它利用连续OT优化的最新进展,实现高效、可扩展的训练,且计算开销极低。
实验结果
研究问题
- RQ1在训练数据有限的情况下,连续最优传输是否能在公平性优化中优于离散OT?
- RQ2基于连续OT的方法在现实世界数据分布中,对不公平水平变化的适应能力如何?
- RQ3在数据充足的情况下,连续OT方法是否能维持与离散OT相当的公平性-准确率权衡?
- RQ4是否可在无需完整重新训练的情况下,对模型进行事后调整以适应新的不公平水平?
- RQ5在训练过程中,连续OT公式中的对偶变量如何反映分布对齐的动态变化?
主要发现
- 在数据稀缺时,连续OT方法在性能上显著优于离散OT,尤其是在样本有限的早期训练阶段。
- 在数据充足时,连续OT与离散OT在公平性表现上相近,以Wasserstein距离(Wass1)衡量。
- 连续OT方法能快速适应不公平水平的变化,参数调整后达到低Wass1值所需的更新次数更少。
- 该方法表现出稳定的收敛性,对偶变量能准确反映分布偏移,特别是在输出分布的尾部区域。
- 在初始参数调整后,模型能迅速进入参数空间中的特定区域,实现对新不公平水平的快速再适应,表明其具备强大的泛化能力和可迁移性。
- 结果表明,连续OT支持对模型进行事后校准以适应不同不公平水平,为现实系统中的动态公平性管理提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。