Skip to main content
QUICK REVIEW

[论文解读] Mitigating Dataset Harms Requires Stewardship: Lessons from 1000 Papers

Kenny Peng, Arunesh Mathur|arXiv (Cornell University)|Aug 6, 2021
Face recognition and analysis参考文献 71被引用 8
一句话总结

本文通过研究近1,000篇引用论文,分析了LFW、MS-Celeb-1M和DukeMTMC三组高影响力的人脸与人员识别数据集的伦理生命周期。研究发现,由于数据广泛可用且执行不力,数据集撤回、许可协议及衍生模型往往无法有效缓解危害,因此主张通过创建者、用户和机构之间的分布式责任,对数据集生命周期实施持续的伦理管理。

ABSTRACT

Machine learning datasets have elicited concerns about privacy, bias, and unethical applications, leading to the retraction of prominent datasets such as DukeMTMC, MS-Celeb-1M, and Tiny Images. In response, the machine learning community has called for higher ethical standards in dataset creation. To help inform these efforts, we studied three influential but ethically problematic face and person recognition datasets -- Labeled Faces in the Wild (LFW), MS-Celeb-1M, and DukeMTM -- by analyzing nearly 1000 papers that cite them. We found that the creation of derivative datasets and models, broader technological and social change, the lack of clarity of licenses, and dataset management practices can introduce a wide range of ethical concerns. We conclude by suggesting a distributed approach to harm mitigation that considers the entire life cycle of a dataset.

研究动机与目标

  • 理解机器学习数据集中伦理危害如何在初始创建后持续存在。
  • 调查数据集撤回、许可协议及衍生模型对伦理风险的长期影响。
  • 识别数据集文档、引用实践和追踪机制中的系统性缺陷。
  • 提出一种分布式管理模型,将伦理责任延伸至数据集创建之后。
  • 为政策和社区实践提供参考,以在整个生命周期中减轻数据集危害。

提出的方法

  • 对1,000篇引用LFW、MS-Celeb-1M和DukeMTMC的论文进行纵向分析,重点关注数据集使用、衍生品及预训练模型。
  • 绘制父数据集及其衍生品(包括标注、处理和基于模型的变体)的生命周期。
  • 评估数据集许可协议的可执行性与一致性,特别是针对非商业用途的限制。
  • 追踪GitHub上的预训练模型,评估其对许可条款的遵守情况及实际生产使用情况。
  • 分析因技术进步和社会认知演变导致伦理关切随时间的变化。
  • 提出一个包含创建者、用户、程序委员会和机构审查委员会(IRBs)的数据库管理框架。

实验结果

研究问题

  • RQ1数据集撤回在多大程度上能有效防止对伦理问题数据的持续使用?
  • RQ2衍生数据集和模型在多大程度上引入了超出原始数据集的新伦理风险?
  • RQ3许可协议在限制数据集的非伦理或商业用途方面有多有效?
  • RQ4技术和社会变化如何随时间改变一个数据集的伦理特征?
  • RQ5当前数据集引用、文档和追踪实践中的主要缺陷是什么?

主要发现

  • 尽管官方已撤回,MS-Celeb-1M和DukeMTMC的数据仍广泛可及并持续被研究使用,表明仅靠撤回无法有效缓解危害。
  • 衍生数据集和模型——尤其是支持生产环境使用或引入新标注的——带来了独特且常被忽视的伦理风险。
  • MS-Celeb-1M等数据集的许可协议执行不一致,仅21个GitHub仓库中的3个明确限制了基于该数据集训练的模型的商业用途。
  • 技术进步使LFW和ImageNet等数据集得以应用于新的生产场景,放大了创建时并不存在的伦理关切,如监控和偏见。
  • 当前的引用和文档实践无法保留持久且可访问的元数据,导致难以追踪数据集的来源或评估其长期影响。
  • 机构审查委员会(IRBs)因对人类受试者的定义过于狭窄且禁止评估下游社会危害,难以有效监管数据集伦理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。