[论文解读] Multi-dimensional discrimination in Law and Machine Learning -- A comparative overview
本文对法律与机器学习中的多维歧视进行了比较综述,识别了来自法律学术研究的关键公平性定义,尤其是交叉性公平性,并分析了其在公平感知机器学习中的可操作化。文章指出了当前机器学习研究中的若干空白,如对累加性歧视和顺序性歧视关注不足、交叉子群体的数据稀缺,以及法律与技术公平性框架之间亟需加强的跨学科协同。
AI-driven decision-making can lead to discrimination against certain individuals or social groups based on protected characteristics/attributes such as race, gender, or age. The domain of fairness-aware machine learning focuses on methods and algorithms for understanding, mitigating, and accounting for bias in AI/ML models. Still, thus far, the vast majority of the proposed methods assess fairness based on a single protected attribute, e.g. only gender or race. In reality, though, human identities are multi-dimensional, and discrimination can occur based on more than one protected characteristic, leading to the so-called ``multi-dimensional discrimination'' or ``multi-dimensional fairness'' problem. While well-elaborated in legal literature, the multi-dimensionality of discrimination is less explored in the machine learning community. Recent approaches in this direction mainly follow the so-called intersectional fairness definition from the legal domain, whereas other notions like additive and sequential discrimination are less studied or not considered thus far. In this work, we overview the different definitions of multi-dimensional discrimination/fairness in the legal domain as well as how they have been transferred/ operationalized (if) in the fairness-aware machine learning domain. By juxtaposing these two domains, we draw the connections, identify the limitations, and point out open research directions.
研究动机与目标
- 考察多维歧视(基于种族、性别、年龄等多个受保护属性)在法律学术研究中的概念化方式,以及其在公平感知机器学习中的可操作化实现。
- 识别当前公平感知机器学习方法的局限性,这些方法主要聚焦于单属性公平性,同时强调累加性与顺序性歧视等概念尚未得到充分探索。
- 应对受保护子群体在训练数据中因属性交叉导致样本过少或为空的问题,即数据稀缺的挑战。
- 通过分析法律公平性概念向机器学习框架的可迁移性,弥合法律与技术公平性之间的鸿沟,包括受保护属性的定义与标注所面临的挑战。
- 提出开放的研究方向,如开发针对小众群体的统计检验方法、改进不同子群体间公平性的权衡机制,以及在GDPR和欧盟人工智能法案等法规框架下实现敏感数据的伦理使用。
提出的方法
- 系统性回顾关于多维歧视的法律文献,包括交叉性、累积性歧视与顺序性歧视。
- 将法律中的公平性概念映射到公平感知机器学习中的可操作化实现,重点关注交叉性公平性在机器学习研究中的采纳情况,以及累加性与顺序性公平性等其他形式仍处于未充分开发状态。
- 分析检测与缓解多维歧视的技术挑战,特别是当多个受保护属性组合时导致的数据稀缺问题。
- 评估现有机器学习公平性度量指标与缓解技术,识别其在处理交叉性与顺序性歧视方面的局限性。
- 提出利用合成数据生成作为缓解数据稀缺的潜在解决方案,同时警示其可能引入子群体偏见的风险。
- 考察GDPR与欧盟人工智能法案等监管框架,特别是第10条第5款,该条款在严格条件下允许使用敏感数据进行偏见检测,以指导公平研究中的伦理数据使用。
实验结果
研究问题
- RQ1法律学术研究如何概念化多维歧视?其中哪些概念已被实现在公平感知机器学习中?
- RQ2为何机器学习领域主要聚焦于交叉性公平性,而对累加性与顺序性歧视则长期忽视?
- RQ3在受保护子群体规模过小、难以进行可靠统计分析时,检测与缓解多维歧视面临哪些技术和伦理挑战?
- RQ4公平性度量指标与缓解技术如何适应多个人群受保护属性之间的公平性权衡?
- RQ5GDPR与欧盟人工智能法案等监管框架在促进负责任地使用数据以检测和纠正人工智能系统中的多维歧视方面,可发挥何种作用?
主要发现
- 绝大多数公平感知机器学习方法仍集中于单维公平性,即基于单一受保护属性(如性别或种族)评估偏见,尽管现实中的歧视本质上是多维的。
- 交叉性公平性——源于批判法律理论与压迫系统重叠的概念——已成为机器学习研究中的主要框架,但累加性与顺序性歧视仍缺乏充分探索。
- 数据稀缺是主要障碍:随着受保护属性数量的增加,交叉子群体的规模急剧缩小,导致统计分析与偏见检测不可靠,尤其对小众或边缘化群体影响显著。
- 法律判例,特别是欧洲法院的判例,依赖的统计测试通常不适用于小规模子群体中的歧视检测,凸显了当前公平性评估方法的不足。
- 欧盟人工智能法案第10条第5款允许在严格条件下使用敏感个人数据进行偏见监控,为缓解数据稀缺问题提供了潜在的监管路径,但伦理与隐私问题依然存在。
- 合成数据生成是具有前景但风险较高的方法,可用于扩充稀有子群体,但若未充分结合社会科学与法律专业知识进行设计,可能嵌入或放大现有偏见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。