[论文解读] Representation Bias in Data: A Survey on Identification and Resolution Techniques
本综述对结构化与非结构化数据中的表示偏差进行了全面分析,提出了针对文本、表格、图像和图数据中识别与解决技术的分类体系及并列比较。研究指出,必须在模型训练前解决源于采样、历史或结构因素的样本代表性不足问题,以确保人工智能的公平性结果。
Data-driven algorithms are only as good as the data they work with, while data sets, especially social data, often fail to represent minorities adequately. Representation Bias in data can happen due to various reasons ranging from historical discrimination to selection and sampling biases in the data acquisition and preparation methods. Given that "bias in, bias out", one cannot expect AI-based solutions to have equitable outcomes for societal applications, without addressing issues such as representation bias. While there has been extensive study of fairness in machine learning models, including several review papers, bias in the data has been less studied. This paper reviews the literature on identifying and resolving representation bias as a feature of a data set, independent of how consumed later. The scope of this survey is bounded to structured (tabular) and unstructured (e.g., image, text, graph) data. It presents taxonomies to categorize the studied techniques based on multiple design dimensions and provides a side-by-side comparison of their properties. There is still a long way to fully address representation bias issues in data. The authors hope that this survey motivates researchers to approach these challenges in the future by observing existing work within their respective domains.
研究动机与目标
- 通过聚焦于数据层面的表示偏差,而非仅关注模型层面的公平性,弥合公平性研究中的关键空白。
- 为结构化(表格)和非结构化(文本、图像、图)数据中识别与解决表示偏差的技术提供系统性分类体系。
- 从数据类型、偏差类型和干预阶段(识别 vs. 解决)等设计维度,对比现有方法。
- 通过揭示流数据、时空数据以及改进的偏差度量指标等开放性挑战,激发未来研究。
- 通过在模型训练前推广公平的数据实践,支持以数据为中心的人工智能发展。
提出的方法
- 提出一个多维分类体系,基于数据类型、偏差来源和干预策略,对表示偏差检测与缓解技术进行分类。
- 将方法划分为识别类(例如,测量子群体覆盖度、代表性比率、图中的同质性)和解决类(例如,数据重加权、嵌入去偏、图结构修改)。
- 分析了通过正交投影至性别/种族向量来去偏词嵌入的技术,以及通过修改图学习中的随机游走来提升公平性的方法。
- 引入覆盖度和代表性比率等指标,以量化少数子群体中的代表性不足程度。
- 评估了如Fairwalk和Fairdrop等方法,通过调整转移概率或删除边来减少基于敏感属性的同质性。
- 综述了通过显式建模表示空间中的偏差,实现公平图嵌入的贝叶斯与组合方法。
实验结果
研究问题
- RQ1如何在表格、文本、图像和图数据等不同类型数据中系统性地识别表示偏差?
- RQ2区分现有表示偏差检测与解决技术的关键设计维度有哪些?
- RQ3当前的解决技术(如嵌入去偏或图结构修改)在缓解少数群体代表性不足方面效果如何?
- RQ4现有指标如覆盖度和代表性比率在多大程度上能捕捉表示偏差的严重性?其局限性是什么?
- RQ5将表示偏差检测与解决扩展到流数据或时空数据等新兴数据类型时,面临哪些开放性挑战?
主要发现
- 由于历史、采样和结构因素,表示偏差在现实世界数据中普遍存在,导致代表性不足的子群体泛化性能差。
- 即使采用均匀采样,由于目标人群中基数较低,少数群体(如孕妇)仍可能持续代表性不足。
- 通过将词嵌入正交化至性别/种族向量来去偏的技术,在自然语言处理中显著减少了刻板印象关联。
- 在图数据中,Fairdrop和Fairwalk等方法通过修改邻接矩阵或转移概率,降低同质性,从而改善节点表示的公平性。
- 覆盖度和代表性比率等指标虽具实用性,但在捕捉复杂或动态数据中的细微偏差模式方面存在局限。
- 目前亟需针对流数据和时空数据开发新型度量指标与可扩展解决方案,因为这些数据中的偏差动态随时间演变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。