[论文解读] The Data-Production Dispositif
本文提出了“数据生产装置”这一福柯式的分析框架,用以探讨拉美地区外包机器学习数据工作如何通过标准化指令、监控机制与不稳定就业状态,再生产出权力/知识的等级结构。研究发现,经济边缘化与自上而下的指令话语强制工人服从,使偏见的数据解读被正常化,从而固化了人工智能系统中的系统性不平等。
Machine learning (ML) depends on data to train and verify models. Very often, organizations outsource processes related to data work (i.e., generating and annotating data and evaluating outputs) through business process outsourcing (BPO) companies and crowdsourcing platforms. This paper investigates outsourced ML data work in Latin America by studying three platforms in Venezuela and a BPO in Argentina. We lean on the Foucauldian notion of dispositif to define the data-production dispositif as an ensemble of discourses, actions, and objects strategically disposed to (re)produce power/knowledge relations in data and labor. Our dispositif analysis comprises the examination of 210 data work instruction documents, 55 interviews with data workers, managers, and requesters, and participant observation. Our findings show that discourses encoded in instructions reproduce and normalize the worldviews of requesters. Precarious working conditions and economic dependency alienate workers, making them obedient to instructions. Furthermore, discourses and social contexts materialize in artifacts, such as interfaces and performance metrics, limiting workers' agency and normalizing specific ways of interpreting data. We conclude by stressing the importance of counteracting the data-production dispositif by fighting alienation and precarization, and empowering data workers to become assets in the quest for high-quality data.
研究动机与目标
- 探究拉美地区外包机器学习数据工作如何通过制度与话语结构再生产出权力与知识的等级体系。
- 分析委托方的世界观如何被编码进任务指令中,并通过劳动实践得以正常化。
- 考察数据工作者在数据标注与注释过程中所受的物质与社会条件制约,及其对自主性的限制。
- 探讨平台与BPO如何通过监控、绩效指标与经济依赖关系强制工人服从。
- 提出通过赋能工人与去商品化其劳动,以对抗该装置的策略。
提出的方法
- 应用装置分析法——基于福柯的装置概念——研究数据工作中话语、实践与物质性产物之间的互动。
- 分析210份数据工作指令文件,识别其中隐含的世界观与分类规范。
- 对55名数据工作者、管理人员与委托方进行访谈,以理解其对指令的解读过程与权力动态。
- 在阿根廷的众包平台与一家BPO开展参与式观察,研究界面设计、监控工具与工作流程的物质性产物。
- 整合语言、行为与物质维度的质性数据,追踪权力/知识关系的(再)生产过程。
- 采用强调主体间可理解性而非客观性的方法论框架,确保在不同语境下解释的合理性。
实验结果
研究问题
- RQ1在拉美地区机器学习数据工作的外包任务指令中,编码了哪些话语?
- RQ2数据工作者、管理人员与委托方如何互动以生成数据?这些互动中浮现了何种权力动态?
- RQ3哪些物质性产物(如界面、绩效指标、监控工具)支持或限制了对指令的遵守?
- RQ4经济上的不稳定与依赖如何影响工人对指令的服从程度,并限制其自主性?
- RQ5指令文件与平台设计在何种方式下使特定数据解读自然化,并边缘化其他视角?
主要发现
- 任务指令系统性地编码了委托方的世界观与隐含假设,使特定数据解读被正常化,同时边缘化其他可能的视角。
- 拉美语境下的经济不稳定与依赖关系使工人别无选择,只能服从指令,从而强化服从而非批判性参与。
- 平台界面与绩效指标将话语规范具象化,限制了工人的自主性,使标准化、往往带有偏见的数据标注实践成为常态。
- 平台中嵌入的监控与控制机制强制工人服从,使数据工作成为一种在市场逻辑下被规训的劳动形式。
- 指令文件是动态的、持续修订的产物,表明存在持续协商,但也强化了对委托方所定义标准的依赖。
- 若将数据工人重新定位为高质量数据的共同生产者,而非单纯的劳动商品,将可能打破该装置,提升数据集的公平性与透明度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。