Skip to main content
QUICK REVIEW

[论文解读] Feature Noise Induces Loss Discrepancy Across Groups

Fereshte Khani, Percy Liang|arXiv (Cornell University)|Nov 22, 2019
Machine Learning and Data Classification被引用 5
一句话总结

本文表明,即使在各组间均匀应用特征噪声,也会在线性回归中引发统计损失差异,这主要归因于各组均值和方差的差异。主要发现是,即使在无限数据且无信息不足的情况下,损失差异依然存在;使用组信息可减少统计损失差异,但会增加反事实损失差异,从而增强对分布偏移的鲁棒性。

ABSTRACT

The performance of standard learning procedures has been observed to differ widely across groups. Recent studies usually attribute this loss discrepancy to an information deficiency for one group (e.g., one group has less data). In this work, we point to a more subtle source of loss discrepancy---feature noise. Our main result is that even when there is no information deficiency specific to one group (e.g., both groups have infinite data), adding the same amount of feature noise to all individuals leads to loss discrepancy. For linear regression, we thoroughly characterize the effect of feature noise on loss discrepancy in terms of the amount of noise, the difference between moments of the two groups, and whether group information is used or not. We then show this loss discrepancy does not vanish immediately if a shift in distribution causes the groups to have similar moments. On three real-world datasets, we show feature noise increases the loss discrepancy if groups have different distributions, while it does not affect the loss discrepancy on datasets where groups have similar distributions.

研究动机与目标

  • 调查在不存在信息不足(如数据稀缺或目标偏差)的情况下,特征噪声是否仍会引发各组间的损失差异。
  • 分析使用组信息如何影响线性回归模型中统计损失差异与反事实损失差异。
  • 理解在协变量偏移下损失差异的持续性,特别是训练与测试分布差异如何影响损失差异。
  • 在具有组间均值、方差和规模差异的真实世界数据集上验证理论发现。

提出的方法

  • 研究采用线性回归设置,其中个体属于组 g ∈ {0,1},潜在特征 z 生成目标 y = βᵀz + α。
  • 观测特征 x 通过两种观测函数建模为 z 的噪声版本:无组信息时为 o₋g(z,g,u) = z + u,有组信息时为 o₊g(z,g,u) = [z + u, g],其中 u 为均值为零的噪声。
  • 统计损失差异(SLD)定义为两组之间期望损失的差异,而反事实损失差异(CLD)则衡量个体与其来自另一组的反事实之间的损失差异。
  • 理论分析推导出 SLD 和 CLD 出现的条件,表明 SLD 取决于组矩(均值、方差、规模)的差异,而 CLD 则源于使用组信息时训练分布的差异。
  • 本文将损失差异分解为与训练和测试分布矩相关的分量,表明若各组具有相似矩,SLD 在分布偏移后会立即消失。
  • 通过在三个真实世界数据集(Students、Law School 和 Communities&Crime)上进行实证验证,使用添加噪声和特征省略作为噪声代理。

实验结果

研究问题

  • RQ1即使两组均拥有无限数据且无信息不足,特征噪声是否仍会引发统计损失差异?
  • RQ2在观测函数中包含组成员身份如何影响统计损失差异与反事实损失差异?
  • RQ3损失差异在协变量偏移下持续存在的程度如何?组信息的使用如何影响这种持续性?
  • RQ4通过数据收集或组特定分类器能否缓解损失差异,还是损失差异本质上源于噪声与分布差异?
  • RQ5在分布偏移后,损失差异在何种条件下会消失?组信息的使用如何改变这一行为?

主要发现

  • 即使在无限数据且无信息不足的情况下,特征噪声仍会导致线性回归中的统计损失差异,且该差异与残差损失的组均值差异成正比,与平方误差损失的组方差差异成正比。
  • 使用组信息可减少统计损失差异,但会增加反事实损失差异,表明公平性度量之间存在权衡。
  • 在无组信息的观测函数 o₋g 下,统计损失差异主要由测试分布的差异驱动,并在分布偏移后若各组矩相似则立即消失。
  • 在有组信息的观测函数 o₊g 下,反事实损失差异主要源于训练分布的差异,且在分布偏移后不会立即消失,因此更具持续性。
  • 在真实世界数据集(如 Communities&Crime 和 Students)中,当组间存在均值、方差和规模差异时,特征噪声会增加损失差异;而在 Law School 数据集中,由于组间相似,噪声无影响。
  • 在重加权数据集以使组均值相等后,o₋g 的统计损失差异立即消失,而 o₊g 的统计损失差异则以与第 3 条命题理论分析一致的速率缓慢衰减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。