[论文解读] Last-Layer Fairness Fine-tuning is Simple and Effective for Neural Networks
本文提出了一种简单而有效的方法,通过仅微调预训练模型的最后几层并应用公平性约束与数据重加权,实现公平的深度神经网络训练。该方法显著减少了对公平性标准的过拟合,并在基准数据集上实现了最先进的公平性-准确率权衡,优于全网络微调和其他基线方法。
As machine learning has been deployed ubiquitously across applications in modern data science, algorithmic fairness has become a great concern. Among them, imposing fairness constraints during learning, i.e. in-processing fair training, has been a popular type of training method because they don't require accessing sensitive attributes during test time in contrast to post-processing methods. While this has been extensively studied in classical machine learning models, their impact on deep neural networks remains unclear. Recent research has shown that adding fairness constraints to the objective function leads to severe over-fitting to fairness criteria in large models, and how to solve this challenge is an important open question. To tackle this, we leverage the wisdom and power of pre-training and fine-tuning and develop a simple but novel framework to train fair neural networks in an efficient and inexpensive way -- last-layer fine-tuning alone can effectively promote fairness in deep neural networks. This framework offers valuable insights into representation learning for training fair neural networks.
研究动机与目标
- 为解决在处理过程中训练时,过参数化的深度神经网络中公平性过拟合的挑战。
- 探究仅微调预训练模型的最后几层是否能有效促进公平性,而无需进行全网络微调。
- 评估在最后几层微调中结合数据重加权与公平性约束的有效性,以改善公平性泛化性能。
- 研究所提出方法在分布外数据和替代微调结构上的泛化能力。
提出的方法
- 使用标准经验风险最小化在源数据集上预训练深度神经网络,以学习鲁棒表征。
- 仅使用公平性约束目标微调最终分类层,同时保持所有其他层冻结。
- 在最后几层微调过程中应用数据重加权,以平衡训练数据中少数群体和多数群体。
- 使用带有动量和权重衰减的随机梯度下降优化最后几层的公平性正则化目标。
- 引入一种新颖的公平性-准确率混合指标(AF),联合评估模型在公平性和准确率上的表现。
- 在多种公平性概念上评估该方法:相等机会差异(Equalized Odds Difference)、准确率相等差异(Accuracy Equality Difference)和最差准确率(Worst Accuracy)。
实验结果
研究问题
- RQ1在大型神经网络中,仅使用公平性约束的最后几层微调能否有效缓解对公平性目标的过拟合?
- RQ2在数据不平衡的数据集上,将数据重加权与最后几层微调结合是否能改善公平性泛化?
- RQ3在公平性和准确率方面,最后几层微调的性能与带有公平性约束的全网络微调相比如何?
- RQ4当表征在源域上训练时,该方法在分布外数据上是否具有泛化能力?
- RQ5仅微调最后几层是否能保持甚至增强模型鲁棒性,相较于微调深层网络?
主要发现
- FDR(带数据重加权的微调)在最差准确率指标上取得了1.701的最高公平性-准确率(AF)得分,优于所有基线方法。
- FDR方法将测试数据上的相等机会差异(EO_Diff)降低至0.107,显著低于FullFT-Reg(0.499)和LastFT-Reg(0.153)。
- 最后几层微调减少了训练与测试公平性指标之间的泛化差距,表明相比全网络训练,其过拟合程度更低。
- FDR在测试集上实现了0.892的WACC和0.958的AUC,展示了强大的预测性能,同时保持了高水平的公平性。
- 该方法在分布外数据上表现出良好的泛化能力,显示出在迁移学习设置下的鲁棒性。
- 尽管准确率较低,但仅微调最后几层并结合公平性约束的方法在公平性指标上优于全网络微调,原因在于其过拟合程度更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。