Skip to main content
QUICK REVIEW

[论文解读] Representation Matters: Assessing the Importance of Subgroup Allocations in Training Data

Esther Rolf, Theodora Worledge|arXiv (Cornell University)|Mar 5, 2021
Explainable Artificial Intelligence (XAI)参考文献 45被引用 7
一句话总结

本文提出了一种缩放模型,用于量化训练数据中子组分配对不同群体及整体人群模型性能的影响。结果表明,数据集构成——尤其是少数群体的代表性不足——是决定公平性和准确性的主要因素,且最优的数据收集策略在减少差异方面优于算法重加权方法。

ABSTRACT

Collecting more diverse and representative training data is often touted as a remedy for the disparate performance of machine learning predictors across subpopulations. However, a precise framework for understanding how dataset properties like diversity affect learning outcomes is largely lacking. By casting data collection as part of the learning process, we demonstrate that diverse representation in training data is key not only to increasing subgroup performances, but also to achieving population level objectives. Our analysis and experiments describe how dataset compositions influence performance and provide constructive results for using trends in existing data, alongside domain knowledge, to help guide intentional, objective-aware dataset design.

研究动机与目标

  • 理解数据集构成,特别是子组分配,如何影响不同人群群体的模型性能。
  • 评估诸如重要性加权等算法干预措施在训练数据不平衡时是否能有效缓解性能差异。
  • 开发一种数据驱动的框架,用于设计最优训练数据集,以最大化公平性和整体人群准确率。
  • 通过利用现有数据中的趋势和领域知识,指导未来数据收集以实现特定性能目标。
  • 将数据收集形式化为机器学习流程的组成部分,而非被动的数据准备步骤。

提出的方法

  • 提出一种缩放模型,以幂律形式描述群体样本量与群体准确率之间的关系:$ \text{accuracy}_g \propto n_g^{\hat{q}_g} \cdot n^{\hat{p}_g} $,其中 $ n_g $ 为群体规模,$ n $ 为总规模。
  • 采用非线性最小二乘拟合方法,从实验数据中估计缩放参数 $ \hat{q}_g $、$ \hat{p}_g $、$ \hat{\tau}_g $ 和 $ \hat{\sigma}_g $。
  • 比较经验风险最小化(ERM)与重要性加权(IW)下的性能表现,测量在不同子组分配 $ \alpha_A $ 下的准确率。
  • 使用交叉验证与超参数调优(如随机森林模型中 $ \texttt{num\_trees}=400 $,$ \texttt{max\_depth}=8 $ 或 $ 16 $)在真实数据集(Mooc、Adult、Goodreads)上评估模型。
  • 分析在模型输入中包含或排除与群体相关特征(如性别、教育程度)的影响,以评估其对性能下降与公平性的影响。
  • 采用 $ \ell_1 $ 和 $ \ell_2 $ 损失最小化(MAE 与 MSE)评估不同性能指标和模型类型(逻辑回归、岭回归、随机森林)下的模型鲁棒性。

实验结果

研究问题

  • RQ1训练数据中子组分配在多大程度上决定了不同人群群体的模型性能?
  • RQ2对代表性不足群体的算法重加权能否弥补数据代表性不足的问题?在何种情况下可能失效甚至损害性能?
  • RQ3何种最优数据集分配策略能够同时最大化最小群体准确率与整体人群准确率?
  • RQ4如何利用现有数据中的趋势指导未来数据收集,以提升公平性与性能?
  • RQ5在模型输入中包含或排除群体特征,如何影响数据分配与模型性能之间的关系?

主要发现

  • 数据集构成是决定模型性能最一致的因素,子组分配的影响强于算法重加权。
  • 所提出的缩放模型能准确捕捉不同群体规模下性能变化的趋势,估计的指数 $ \hat{q}_g $ 和 $ \hat{p}_g $ 表明,群体规模 $ n_g $ 的影响比总规模 $ n $ 更为显著,尤其当 $ n_g \geq 50 $ 时。
  • 当模型中不包含群体特征时,重要性加权(IW)对性能的负面影响略有降低,表明未显式包含群体特征的模型对分配不平衡更具鲁棒性。
  • 最小化总体风险的最优分配策略倾向于过度代表少数群体,表明公平性与整体准确率目标通常是一致的。
  • 可利用少量初始样本估计缩放参数,并指导后续数据收集,以在不牺牲整体准确率的前提下最大化最小群体准确率。
  • 在 Adult 数据集中,排除性别特征在极端分配设置($ \alpha_A \approx 0 $ 或 $ 1 $)下提升了性能;而在 Mooc 数据集中,包含人口统计特征则提升了 'edu ≤ secondary' 群体的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。