[论文解读] Documenting Data Production Processes: A Participatory Approach for Data Work
本文提出一种参与式方法,用于记录机器学习中的数据生产流程,将关注点从静态的数据集文档转向动态、协作式的文档,以反映数据工作者的真实工作体验。通过在保加利亚和阿根廷两家BPO公司历时2.5年的共同设计,研究发现,数据工作者优先关注能够跨越团队传递信息、支持反馈回路并保留其声音的文档——这为提升机器学习供应链中的透明度与公平性提供了边界对象模型。
The opacity of machine learning data is a significant threat to ethical data work and intelligible systems. Previous research has addressed this issue by proposing standardized checklists to document datasets. This paper expands that field of inquiry by proposing a shift of perspective: from documenting datasets toward documenting data production. We draw on participatory design and collaborate with data workers at two companies located in Bulgaria and Argentina, where the collection and annotation of data for machine learning are outsourced. Our investigation comprises 2.5 years of research, including 33 semi-structured interviews, five co-design workshops, the development of prototypes, and several feedback instances with participants. We identify key challenges and requirements related to the integration of documentation practices in real-world data production scenarios. Our findings comprise important design considerations and highlight the value of designing data documentation based on the needs of data workers. We argue that a view of documentation as a boundary object, i.e., an object that can be used differently across organizations and teams but holds enough immutable content to maintain integrity, can be useful when designing documentation to retrieve heterogeneous, often distributed, contexts of data production.
研究动机与目标
- 通过将文档关注点从静态数据集转向动态、面向流程的实践,解决机器学习数据生产过程的不透明性问题。
- 探究文档如何缓解涉及外包数据工作的机器学习供应链中的信息不对称问题。
- 理解全球外包数据生产环境中数据工作者的具体文档需求。
- 共同设计反映现实数据工作协作性、迭代性与分布式特性的文档工具。
- 开发一种作为边界对象的文档模型——可在不同团队和组织间灵活适应,同时保持核心完整性与工作者声音。
提出的方法
- 在阿根廷和保加利亚的两家业务流程外包(BPO)公司对数据工作者及管理人员进行了33次半结构化访谈。
- 与数据工作者共同举办了五场设计工作坊,协作原型化并优化文档工具。
- 基于参与者反馈,持续开发并迭代文档原型,强调反馈回路与迭代优化。
- 应用参与式设计原则,突出数据工作者的视角,尤其在克服管理层的把关机制与自上而下的沟通模式方面。
- 采用边界对象框架,将文档概念化为一种共享成果物,在保持完整性的同时,可在不同团队和组织间灵活适应。
- 在设计过程中融入文化与语言多样性考量,调整方法以克服跨文化协作中的语言与权力障碍。
实验结果
研究问题
- RQ1如何使文档反映数据生产流程的迭代性与协作性?
- RQ2文档实践如何有助于缓解数据生产与机器学习供应链中的信息不对称问题?
- RQ3数据工作者在最佳工作条件下需要哪些信息,以及如何将其纳入文档中?
- RQ4文档如何作为边界对象,支持地理与文化上分散的利益相关者之间的协作?
- RQ5在以数据工作者声音为中心创建数据生产文档时,会浮现哪些设计考量?
主要发现
- 数据工作者优先选择能够跨越组织与文化边界传递任务、团队及薪酬信息的文档。
- 工作者期望文档能支持反馈回路,使其能够将关切与建议反馈给请求方与管理者。
- 自上而下的线性文档实践被认为不足;工作者更偏好随工作演进而发展的循环式、迭代式文档。
- 让工作者主导设计过程,揭示了此前未明确表达的需求,如任务分配与薪酬结构的透明化。
- 边界对象模型在实现团队间灵活性与保持足够稳定性以维护完整性与共同理解之间发挥了重要作用。
- 管理层的把关行为限制了早期原型的开发,凸显了建立由工作者主导的设计空间以揭示真实需求的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。