Skip to main content
QUICK REVIEW

[论文解读] Sociotechnical Implications of Generative Artificial Intelligence for Information Access

Bhaskar Mitra, Henriette Cramer|arXiv (Cornell University)|May 19, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用 3
一句话总结

本文使用后果-机制-风险(CMR)框架,探讨生成式人工智能在信息获取中的社会技术影响,识别出系统性风险,如信息生态系统破坏、权力集中、偏见放大和环境损害。文章提出了评估与缓解策略,强调伦理设计、数据劳动倡导,以及在人工智能驱动的信息检索系统中重新聚焦社会需求。

ABSTRACT

Robust access to trustworthy information is a critical need for society with implications for knowledge production, public health education, and promoting informed citizenry in democratic societies. Generative AI technologies may enable new ways to access information and improve effectiveness of existing information retrieval systems but we are only starting to understand and grapple with their long-term social implications. In this chapter, we present an overview of some of the systemic consequences and risks of employing generative AI in the context of information access. We also provide recommendations for evaluation and mitigation, and discuss challenges for future research.

研究动机与目标

  • 分析生成式人工智能在信息获取中带来的系统性社会技术风险,尤其聚焦于大语言模型(LLMs)。
  • 识别生成式人工智能如何破坏信息生态系统、集中权力,并加剧知识生产与获取中的不平等。
  • 探讨数据劳动、环境成本以及人工智能对齐在塑造伦理且可持续的信息检索系统中的作用。
  • 提出基于社会技术系统思维和利益相关者中心设计的可操作评估与缓解策略。
  • 通过重新聚焦社会需求,挑战当前人工智能在信息检索中的发展轨迹,并构想信息获取的解放性未来。

提出的方法

  • 采用 Gausen 等人提出的后果-机制-风险(CMR)框架,以结构化方式分析社会技术影响。
  • 将识别出的后果(如信息生态系统破坏)映射到其潜在机制(如内容污染、直接模型访问)及其相关风险。
  • 在信息检索背景下,综合现有关于大语言模型风险的文献,包括偏见、对齐问题、数据劳动和环境影响。
  • 提出以数据为核心的缓解策略,如数据分红、集体行动(如数据罢工)以及替代许可模式。
  • 整合来自劳工组织(如好莱坞罢工)和技术反制措施(如数据中毒工具 NightShade、Glaze、Mist)的见解。
  • 通过 Mitra 的利益相关者需求层级框架重新定义信息检索研究,倡导在系统设计中转向社会福祉与公平。

实验结果

研究问题

  • RQ1生成式人工智能系统如何破坏信息生态系统?其背后的作用机制是什么?
  • RQ2在人工智能驱动的信息获取中,权力集中、偏见放大和环境退化等系统性风险有哪些?
  • RQ3如何在生成式人工智能模型训练过程中伦理地认可并补偿数据劳动?
  • RQ4集体行动和替代商业模式在缓解信息检索中生成式人工智能带来的危害方面可发挥何种作用?
  • RQ5如何使信息检索研究与系统开发重新以社会需求为中心,而非仅关注技术可行性?

主要发现

  • 生成式人工智能通过内容污染、搜索引擎操纵以及知识传播中的“电话效应”引入系统性风险,导致信息生态系统破坏。
  • 大型人工智能开发者的权力集中,源于计算能力和数据壁垒,导致人工智能说服力和对齐挑战,威胁民主与公平的信息获取。
  • 代表性不足群体的边缘化以及偏见的放大,因数据劳动的攫取以及训练数据和模型开发中代表性不足而加剧。
  • 训练和部署大语言模型带来的环境成本,包括高资源需求和废弃物排放,对可持续性和生态公平构成重大长期风险。
  • 数据分红、数据罢工以及集体组织(如受好莱坞罢工启发)等缓解策略,有望赋能数据生产者并重新确立利益相关者的控制权。
  • 信息检索研究亟需根本性转变——通过 Mitra 的利益相关者需求层级等框架,重新聚焦社会需求,以构想解放性、公平的信息获取未来。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。