[論文レビュー] Decolonial AI Alignment: Openness, Viśe\d{s}a-Dharma, and Including Excluded Knowledges
本稿は、オープン性、文脈特異的道徳枠組み(viśeṣa-dharma)、および排除された知識体系(特にヒンズー道徳哲学からのもの)を大規模言語モデルの整合性に統合することにより、AI整合性における脱植民的アプローチを提案する。モデル、社会、認識論的オープン性を提唱することで、パラメータ効率の良い微調整(LoRA行列を用いて)により文脈に応じた非普遍的道徳価値を実現し、AIにおける道徳的絶対主義に対抗する技術的に実現可能なアーキテクチャを提供する。
Prior work has explicated the coloniality of artificial intelligence (AI) development and deployment through mechanisms such as extractivism, automation, sociological essentialism, surveillance, and containment. However, that work has not engaged much with alignment: teaching behaviors to a large language model (LLM) in line with desired values, and has not considered a mechanism that arises within that process: moral absolutism -- a part of the coloniality of knowledge. Colonialism has a history of altering the beliefs and values of colonized peoples; in this paper, I argue that this history is recapitulated in current LLM alignment practices and technologies. Furthermore, I suggest that AI alignment be decolonialized using three forms of openness: openness of models, openness to society, and openness to excluded knowledges. This suggested approach to decolonial AI alignment uses ideas from the argumentative moral philosophical tradition of Hinduism, which has been described as an open-source religion. One concept used is viśe\d{s}a-dharma, or particular context-specific notions of right and wrong. At the end of the paper, I provide a suggested reference architecture to work toward the proposed framework.
研究の動機と目的
- AI整合性における知識の植民的性を是正すること、特に閉鎖的LLMを通じた西洋的道徳的普遍主義の強制を目的とする。
- 非西洋的、文脈特異的な倫理的体系を排除する整合性実践における道徳的絶対主義の優位性に挑戦すること。
- 多様で現地に根ざした道徳的価値をLLMに統合する技術的に実現可能なフレームワークを開発すること。
- アプリケーション開発者やコミュニティが自らの価値観と認識論をモデルと一致させることを可能にする参照アーキテクチャを提言すること。
- モデル提供者が支配的メトロポリス的制御をとる慣行から、コミュニティ主導で認識論的に多様な整合性へと業界の規範を転換すること。
提案手法
- モデルのオープン性(例:重みとアーキテクチャ)、社会へのオープン性(多様なコミュニティの統合)、排除された知識へのオープン性(非西洋的認識論)の3つの形態を提唱する。
- ヒンズー道徳哲学からの文脈特異的道徳的義務(viśeṣa-dharma)を、整合性における普遍的道徳枠組みの反対として導入する。
- 知識工学的手法を用いて、地域的・先住民的道徳体系をパラメータ効率の良い微調整に適したLoRA(低ランク適応)行列に符号化する。
- 社会的および状況的入力をもとに、適切な文脈に応じたLoRA行列を選択するバディットオーケストレータを採用し、動的かつ適応的な整合的行動を実現する。
- 文脈特異的LoRA行列の保存・バージョニングが可能なモジュラーなLoraHubに類似したライブラリを備えた参照アーキテクチャを構築する。
- コミュニティからのフィードバックと評価に基づき、反復的に道徳的整合性を再検討・洗練するフィードバックループを統合する。

実験結果
リサーチクエスチョン
- RQ1現在のLLM整合性の実践は、道徳的絶対主義を通じてどのように植民的権力構造を再現しているのか?
- RQ2非西洋的道徳体系が整合性プロセスから排除されることにより、どのような形で認識論的暴力が生じるのか?
- RQ3非西洋的伝統からの文脈特異的道徳性(viśeṣa-dharma)を統合できる技術的に実現可能な整合性フレームワークを構築できるか?
- RQ4モデルのオープン性をコードと重みの範囲を超えて、疎外された知識体系への認識論的オープン性へと拡張できるか?
- RQ5モデルのパフォーマンスや安全性を損なわずに、動的かつ文脈に応じた整合性を実現するためのアーキテクチャパターンは何か?
主な発見
- 本稿は、AI整合性における道徳的絶対主義が、知識の植民的性の主要なメカニズムであると特定し、唯一普遍的で西洋的道徳枠組みが優遇されていると指摘する。
- 閉鎖的LLMは、コミュニティの参加なしに提供者による価値観を強制し、植民地的メトロポリスに類似した搾取的権力構造を強化する。
- 提案されたアーキテクチャにより、LoRA行列を通じた文脈特異的道徳的整合性の動的選択が可能となり、異なる展開環境に応じて異なる価値を適用できる。
- 知識工学的手法とパラメータ効率の良い微調整を用いて排除された知識を統合することで、完全な再訓練を要せず、多様な道徳的整合性を支援する。
- フィードバック駆動による道徳的整合性の見直しが可能となり、反復的改善と倫理的行動におけるコミュニティ主導の所有感を実現する。
- 本アプローチは、脱植民的整合性が哲学的に妥当であるだけでなく、LoRAやモジュラーなモデル管理といった既存技術を用いて技術的に実現可能であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。