[论文解读] Decoupled classifiers for fair and efficient machine learning
本文提出解耦分类器,通过为每个敏感群体(如种族、性别)训练独立的模型,消除在机器学习中使用敏感属性时各群体间固有的准确率权衡。通过结合群体特定训练、迁移学习以及平衡公平性与准确性的联合损失函数,该方法在群体层面实现更优性能,减少偏差,尤其在主流群体特征主导标准分类器的情况下表现更优。
When it is ethical and legal to use a sensitive attribute (such as gender or race) in machine learning systems, the question remains how to do so. We show that the naive application of machine learning algorithms using sensitive features leads to an inherent tradeoff in accuracy between groups. We provide a simple and efficient decoupling technique, that can be added on top of any black-box machine learning algorithm, to learn different classifiers for different groups. Transfer learning is used to mitigate the problem of having too little data on any one group. The method can apply to a range of fairness criteria. In particular, we require the application designer to specify as joint loss function that makes explicit the trade-off between fairness and accuracy. Our reduction is shown to efficiently find the minimum loss as long as the objective has a certain natural monotonicity property which may be of independent interest in the study of fairness in algorithms.
研究动机与目标
- 解决在机器学习中使用敏感属性时,不同人口统计群体之间固有的准确率权衡问题。
- 开发一种实用、即插即用的方法,通过按群体解耦分类器,在不牺牲准确率的前提下提升公平性。
- 通过联合损失函数实现特定应用的公平性目标,平衡准确率与公平性度量。
- 证明解耦结合迁移学习优于标准耦合分类器,尤其在低资源群体中表现更优。
- 提供一种黑箱约简方法,适用于任何现成分类器,并在弱单调性约束下高效优化公平性。
提出的方法
- 使用群体特定数据为每个敏感群体单独训练分类器,实现各群体独立的决策边界。
- 利用迁移学习通过共享全局模型的预训练权重,提升低资源群体的性能。
- 定义联合损失函数,惩罚群体间公平性度量(如假正例率、预测值)的差异。
- 使用黑箱约简方法优化联合损失,若损失函数满足弱单调性性质,则保证全局最优。
- 将方法应用于线性分类器、支持向量机和神经网络特征,证明其在表格数据与图像数据上的有效性。
- 使用预训练的 CaffeNet 模型提取图像特征,并评估性别分类中的偏差。
实验结果
研究问题
- RQ1为每个敏感群体单独训练分类器是否能消除使用敏感属性时群体间固有的准确率权衡?
- RQ2在解耦分类系统中,迁移学习如何提升低资源群体的性能?
- RQ3在图像分类中,解耦在多大程度上减少了主流特征偏差?尤其当少数群体图像因与主流群体特征相似而被误分类时?
- RQ4能否通过黑箱约简高效优化结合公平性与准确率标准的联合损失函数?
- RQ5在群体表示不平衡的真实数据集中,解耦分类是否优于标准耦合分类器?
主要发现
- 解耦分类器显著降低了图像分类中的偏差:耦合分类器因主流群体特征错误地将穿燕尾服的女性分类为‘西装’,而解耦分类器避免了此错误。
- 迁移学习显著提升了少数群体的性能;若无迁移学习,解耦分类器在多个数据集上表现不如耦合分类器。
- 耦合与解耦的线性 SVM 在五折交叉验证中均达到 94.5% 准确率,但解耦模型在最高预测结果中表现出更低的主流特征偏差。
- 只要目标函数满足弱单调性性质,该方法即可实现联合损失函数的全局最优,从而实现高效优化。
- 解耦方法允许应用设计者通过可定制的联合损失显式定义公平性-准确率权衡,使其可适配多种公平性标准。
- 实证结果表明,解耦可降低某些数据集和敏感特征的损失,尤其在使用迁移学习缓解数据稀缺时效果更显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。