QUICK REVIEW
[论文解读] An Ethical Highlighter for People-Centric Dataset Creation
Margot Hanley, Apoorv Khandelwal|arXiv (Cornell University)|Nov 27, 2020
Big Data Technologies and Applications参考文献 19被引用 8
一句话总结
本文提出了一种「伦理标注器」框架,用于指导计算机视觉中以人为中心的数据集的伦理创建与评估,该框架围绕四个核心组件——创建、构成、分发和目的——构建,每个组件均关联特定的伦理问题,如隐私、公平性和代表性伤害。该框架提供了可操作的、基于原则的指导,帮助研究人员主动应对伦理风险,提升数据集的问责制与透明度。
ABSTRACT
Important ethical concerns arising from computer vision datasets of people have been receiving significant attention, and a number of datasets have been withdrawn as a result. To meet the academic need for people-centric datasets, we propose an analytical framework to guide ethical evaluation of existing datasets and to serve future dataset creators in avoiding missteps. Our work is informed by a review and analysis of prior works and highlights where such ethical challenges arise.
研究动机与目标
- 解决以人为中心的计算机视觉数据集中日益增长的伦理关切,这些关切已导致数据集下架和声誉损害。
- 为数据集创建者提供一种结构化且可操作的框架,以在数据集开发过程中评估并减轻伦理风险。
- 通过将特定伦理问题与数据集创建的具体阶段相联系,扩展现有的透明度举措(如数据集说明书),实现更深入的伦理映射。
- 通过在研究生命周期中嵌入伦理反思,促进学术数据集的长期可持续性与公众信任。
提出的方法
- 该框架基于四个核心组件构建:创建、构成、分发和目的,每个组件代表伦理问题可能出现的阶段。
- 通过归纳分析14个广泛使用或具争议性的以人为中心的数据集,将伦理问题映射至这些组件。
- 分析识别出八个关键伦理类别:公平性、隐私、主体自主权、安全/保障、财产权、代表性伤害、冒犯性内容,以及透明度/可解释性。
- 通过已撤下或受批评的数据集中的真实案例(如Duke MTMC和Brainwash)说明各组件的伦理失当如何发生。
- 该框架强调关系伦理,尤其关注数据集目的如何与构成、分发及创建实践相互作用。
- 该方法旨在具有反思性与质询性,鼓励数据集创建者在发布前后系统性地评估伦理风险。
实验结果
研究问题
- RQ1数据集创建者如何在开发以人为中心的数据集过程中主动识别并减轻伦理风险?
- RQ2伦理问题在数据集创建生命周期中以何种方式显现——特别是在数据采集、标注、分发和预期用途方面?
- RQ3如何通过组件特定的伦理分析,增强现有透明度实践(如数据集说明书)?
- RQ4当数据集被重新用于监控或偏见应用时,其目的在放大或减轻伦理伤害方面发挥何种作用,尤其是在边缘化群体中?
- RQ5除了文档化之外,如何在数据集创建中制度化伦理问责,包括访问控制和使用政策?
主要发现
- 该框架成功识别出四个伦理问题常见的独立组件:创建、构成、分发和目的。
- 许多具有高影响力的数据库,如Duke MTMC和Brainwash,因数据采集过程中存在隐私侵犯和缺乏知情同意而被撤下。
- 如冒犯性标签、代表性伤害和偏差分布等伦理问题,可追溯至创建阶段的数据整理与标注实践中的缺陷。
- 当数据集被重新用于监控或与原始意图不符的识别任务时,目的相关的伦理风险尤为突出,可能对边缘化群体造成潜在伤害。
- Labeled Faces in the Wild和VGGFace2等数据集的免责声明虽为积极举措,但仍显不足;需通过主动的访问控制和使用政策来确保伦理使用。
- 该框架通过将目的与其他组件关联,实现对伦理风险的系统性、关系性评估,相比孤立的文档化方法,提供了更具整体性的解决路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。