Skip to main content
QUICK REVIEW

[论文解读] Decolonial AI Alignment: Openness, Viśe\d{s}a-Dharma, and Including Excluded Knowledges

Kush R. Varshney|arXiv (Cornell University)|Sep 10, 2023
Anthropological Studies and Insights被引用 5
一句话总结

本文提出了一种去殖民化的AI对齐方法,将开放性、情境特定的道德框架(viśeṣa-dharma)以及被排除的知识体系——尤其是印度教道德哲学中的知识——整合进大型语言模型的对齐过程中。通过倡导模型、社会及认识论层面的开放性,该框架借助LoRA矩阵实现参数高效微调,实现情境敏感的非普适性道德价值,为对抗AI中的道德绝对主义提供了一种技术上可行的架构。

ABSTRACT

Prior work has explicated the coloniality of artificial intelligence (AI) development and deployment through mechanisms such as extractivism, automation, sociological essentialism, surveillance, and containment. However, that work has not engaged much with alignment: teaching behaviors to a large language model (LLM) in line with desired values, and has not considered a mechanism that arises within that process: moral absolutism -- a part of the coloniality of knowledge. Colonialism has a history of altering the beliefs and values of colonized peoples; in this paper, I argue that this history is recapitulated in current LLM alignment practices and technologies. Furthermore, I suggest that AI alignment be decolonialized using three forms of openness: openness of models, openness to society, and openness to excluded knowledges. This suggested approach to decolonial AI alignment uses ideas from the argumentative moral philosophical tradition of Hinduism, which has been described as an open-source religion. One concept used is viśe\d{s}a-dharma, or particular context-specific notions of right and wrong. At the end of the paper, I provide a suggested reference architecture to work toward the proposed framework.

研究动机与目标

  • 解决AI对齐中的知识殖民性,特别是通过封闭的LLM强加西方道德普遍主义的问题。
  • 挑战在对齐实践中占据主导地位的道德绝对主义,该绝对主义排斥非西方、情境特定的伦理体系。
  • 开发一种技术上可行的框架,通过开放性和知识工程,将多样化的、基于本地的道德价值观整合进LLM中。
  • 提出一种参考架构,使应用开发者和社区能够将其模型与自身的价值观和认识论对齐。
  • 推动行业规范从模型提供方向着类似中心城市的控制模式,转向由社区主导、认识论多元的对齐模式。

提出的方法

  • 提出三种开放形式:模型开放(如权重和架构)、对社会的开放(包容多样化社区)、对被排除知识的开放(非西方认识论)。
  • 引入源自印度教道德哲学的viśeṣa-dharma——情境特定的道德义务——作为对对齐中普遍主义道德框架的替代。
  • 通过知识工程将本地及原住民道德体系编码进LoRA(低秩适应)矩阵中,实现参数高效的微调。
  • 采用带兵协调器,根据社会和情境输入动态选择合适的情境LoRA矩阵,以实现对齐行为的动态应用。
  • 构建一个参考架构,包含类似LoraHub的模块化库,用于存储和版本化情境特定的LoRA矩阵。
  • 整合反馈回路,基于社区输入和评估,迭代修订和优化道德对齐。
Figure 1. System diagram of proposed decolonial AI alignment architecture.
Figure 1. System diagram of proposed decolonial AI alignment architecture.

实验结果

研究问题

  • RQ1当前LLM对齐实践如何通过道德绝对主义再现殖民权力结构?
  • RQ2在对齐过程中排除非西方道德体系,是否构成一种认识论暴力?
  • RQ3能否构建一种技术上可行的对齐框架,整合非西方传统中的情境特定道德(viśeṣa-dharma)?
  • RQ4如何将模型开放性从代码和权重扩展到对边缘化知识体系的认识论开放?
  • RQ5何种架构模式能够在不牺牲模型性能或安全性的前提下,实现动态、情境感知的对齐?

主要发现

  • 本文识别出AI对齐中的道德绝对主义是知识殖民性的一个关键机制,即仅将普遍主义的、西方的道德框架视为优先。
  • 封闭的LLM在无社区参与的情况下强制实施提供方的价值观,强化了类似殖民中心城市的掠夺性权力动态。
  • 所提出的架构通过LoRA矩阵实现情境特定道德对齐的动态选择,使不同价值可在不同部署情境中应用。
  • 通过知识工程和参数高效微调整合被排除的知识,该框架支持多元道德对齐,而无需完全重新训练。
  • 该系统支持基于反馈的道德对齐修订,实现迭代改进,并赋予社区对伦理行为的拥有权。
  • 该方法表明,去殖民化对齐不仅在哲学上站得住脚,而且通过现有技术(如LoRA和模块化模型管理)在技术上是可行的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。