Skip to main content
QUICK REVIEW

[论文解读] A Normative approach to Attest Digital Discrimination

Natalia Criado, Xavier Ferrer Aran|arXiv (Cornell University)|Jul 14, 2020
Ethics and Social Impacts of AI参考文献 14被引用 6
一句话总结

本文提出了一种规范性框架,通过形式化的非歧视规范来检测机器学习系统中的数字歧视。该框架引入了一种算法,通过分析受保护属性和结果来检查机器学习模型是否违反这些规范,使非技术用户无需具备统计学或机器学习专业知识即可评估公平性。

ABSTRACT

Digital discrimination is a form of discrimination whereby users are automatically treated unfairly, unethically or just differently based on their personal data by a machine learning (ML) system. Examples of digital discrimination include low-income neighbourhood's targeted with high-interest loans or low credit scores, and women being undervalued by 21% in online marketing. Recently, different techniques and tools have been proposed to detect biases that may lead to digital discrimination. These tools often require technical expertise to be executed and for their results to be interpreted. To allow non-technical users to benefit from ML, simpler notions and concepts to represent and reason about digital discrimination are needed. In this paper, we use norms as an abstraction to represent different situations that may lead to digital discrimination. In particular, we formalise non-discrimination norms in the context of ML systems and propose an algorithm to check whether ML systems violate these norms.

研究动机与目标

  • 应对由机器学习驱动的自动化决策系统中日益严重的数字歧视挑战。
  • 使非技术用户无需具备统计学或机器学习专业知识,即可评估机器学习系统是否存在潜在歧视。
  • 将直接歧视、间接歧视和隐性歧视形式化为机器学习情境下的规范性规则。
  • 开发一种实用算法,以检查对非歧视规范的合规性并识别违规条件。
  • 明确说明在何种假设下可认为机器学习系统不具歧视性。

提出的方法

  • 使用输入特征 𝒫(受保护属性)、输入特征 𝒫 和输出特征 O 定义机器学习系统,所有特征均具有离散域。
  • 将非歧视规范形式化为受保护属性与模型输出之间的逻辑约束,区分显性歧视、隐性歧视和间接歧视。
  • 将规范表示为有向图,其中节点为属性,边通过方程编码条件关系。
  • 使用统计检验(例如卡方检验)评估受保护属性与结果之间的独立性,以识别潜在的间接歧视。
  • 集成事后可解释性技术(如 LIME),为违规生成反事实解释。
  • 设计一种验证算法,检查模型输出是否符合规范性约束,并在特定假设下报告违规情况。

实验结果

研究问题

  • RQ1如何在机器学习系统的背景下,形式化表示非歧视规范,以支持自动化公平性评估?
  • RQ2何种算法方法可在无需技术专业知识的情况下检测直接、间接和隐性数字歧视?
  • RQ3在何种假设下,可使用规范性推理声明一个机器学习系统不具歧视性?
  • RQ4如何将所提出的框架应用于现实世界案例研究,以验证其实际可行性和有效性?
  • RQ5可解释人工智能技术在提升机器学习系统中规范违规可解释性方面有哪些作用?

主要发现

  • 所提出的规范性框架使非技术用户能够通过将复杂的公平性度量抽象为可理解的规范,来推理数字歧视问题。
  • 验证算法成功通过分析受保护属性与结果之间的统计独立性,识别出机器学习系统中潜在的非歧视规范违规。
  • 该方法通过形式化的逻辑和统计约束,区分显性、隐性和间接歧视。
  • 案例研究证明,该算法能够检测出对性别和收入群体的差异影响等歧视性模式。
  • 与可解释人工智能技术(如 LIME)的集成,通过生成检测到的违规的反事实解释,增强了透明度。
  • 该框架明确列出了可认为机器学习系统无歧视性的假设,支持可审计性和监管合规。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。