[论文解读] Simple data balancing achieves competitive worst-group-accuracy
该论文表明,通过子采样或重加权类别和组别实现的简单数据平衡方法,在四个基准数据集(CelebA、Waterbirds、MultiNLI、CivilComments)上实现了最先进水平的最差组准确率,优于复杂的gDRO和JTT等方法。特别是子采样方法,能够实现稳健、快速的训练,且超参数调优极少,长期训练下性能也保持稳定。
We study the problem of learning classifiers that perform well across (known or unknown) groups of data. After observing that common worst-group-accuracy datasets suffer from substantial imbalances, we set out to compare state-of-the-art methods to simple balancing of classes and groups by either subsampling or reweighting data. Our results show that these data balancing baselines achieve state-of-the-art-accuracy, while being faster to train and requiring no additional hyper-parameters. In addition, we highlight that access to group information is most critical for model selection purposes, and not so much during training. All in all, our findings beg closer examination of benchmarks and methods for research in worst-group-accuracy optimization.
研究动机与目标
- 调查常见最差组准确率基准是否因数据不平衡而影响模型性能。
- 评估简单数据平衡技术(子采样和重加权)在最差组准确率优化方面相对于最先进方法的有效性。
- 确定在弱监督设置下,属性信息在训练阶段与模型选择阶段的重要性差异。
- 挑战‘更多数据总是能提升最差组性能’的假设,尤其是在分布偏移情况下。
提出的方法
- 作者分析了四个标准的最差组准确率基准(CelebA、Waterbirds、MultiNLI、CivilComments)中的类别和组别不平衡问题。
- 他们通过类别级别子采样(SUBY)和组别级别子采样(SUBG),以及重加权方法(RWY、RWG)来平衡类别和组别的分布。
- 所有模型均使用标准深度学习流程进行训练,评估重点集中在所有组别的最差组准确率。
- 该研究比较了长时间训练过程中的性能表现,评估了对正则化超参数的敏感性及稳定性。
- 通过线性模型得出理论见解,解释重加权与子采样之间的差异,特别是其与正则化的相互作用。
- 在多个数据集和模型上进行了实证比较,包括ERM、gDRO、JTT以及所提出的基线方法。
实验结果
研究问题
- RQ1常见最差组准确率基准是否表现出显著的类别和组别不平衡,从而影响模型性能?
- RQ2像子采样和重加权这样的简单数据平衡技术,能否在最差组准确率方面与最先进方法相媲美?
- RQ3在弱监督设置下,属性信息在模型选择阶段是否比在训练阶段更为关键?
- RQ4重加权与子采样在长期训练过程中对模型泛化能力和鲁棒性的影响有何不同?
- RQ5当前基准在多大程度上真实反映了分布偏移问题,还是仅通过简单数据平衡即可解决?
主要发现
- 简单的组别级别子采样(SUBG)在所有四个基准上均实现了最先进水平的最差组准确率,优于复杂的gDRO和JTT等方法。
- 子采样方法(SUBY和SUBG)在长时间训练中表现出更稳定的性能,而基于重加权的方法(RWY、RWG、gDRO)在初始峰值后性能下降。
- 重加权方法需要强正则化才能表现良好,而子采样即使在无正则化条件下也能保持性能,表明其在优化行为上存在根本性差异。
- 在CelebA上表现最佳的重加权模型(RWG)仅训练了3个周期,表明其通过有放回加权采样实际上对多数组进行了有效子采样。
- 子采样训练速度更快,对正则化超参数的敏感性更低,且比重加权或复杂基线方法更适用于超参数搜索。
- 结果挑战了‘更多数据总是能提升最差组性能’的假设,尤其是在数据不平衡的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。