[論文レビュー] Reclaiming the Digital Commons: A Public Data Trust for Training Data
本論文は、基盤モデルの学習データを管理する国家的公共データ信託を提唱し、インターネットからスクレイピングしたデータを商業開発者にライセンスすることで、収益分配を伴い、AI開発に対する集団的コントロールを可能にする。この信託は、経済的価値の再分配、ネガティブ外部効果の低減、検証、インcentive、規制整合性を通じた民主的監視を実現することを目的としている。
Democratization of AI means not only that people can freely use AI, but also that people can collectively decide how AI is to be used. In particular, collective decision-making power is required to redress the negative externalities from the development of increasingly advanced AI systems, including degradation of the digital commons and unemployment from automation. The rapid pace of AI development and deployment currently leaves little room for this power. Monopolized in the hands of private corporations, the development of the most capable foundation models has proceeded largely without public input. There is currently no implemented mechanism for ensuring that the economic value generated by such models is redistributed to account for their negative externalities. The citizens that have generated the data necessary to train models do not have input on how their data are to be used. In this work, we propose that a public data trust assert control over training data for foundation models. In particular, this trust should scrape the internet as a digital commons, to license to commercial model developers for a percentage cut of revenues from deployment. First, we argue in detail for the existence of such a trust. We also discuss feasibility and potential risks. Second, we detail a number of ways for a data trust to incentivize model developers to use training data only from the trust. We propose a mix of verification mechanisms, potential regulatory action, and positive incentives. We conclude by highlighting other potential benefits of our proposed data trust and connecting our work to ongoing efforts in data and compute governance.
研究の動機と目的
- AI開発および学習データに対する民間企業による権力の集中を是正すること。
- AIの負の外部効果(例:デジタル・コモンズの劣化、経済的不平等)を是正すること。
- AIによって生み出された経済的価値をデータ貢献者に再分配するメカニズムを確立すること。
- 市民がAIシステムの学習および展開方法について集団的意思決定権を持つこと。
- 公共の利益と民主的監視を支援する、実行可能でスケーラブルな学習データのガバナンスモデルを構築すること。
提案手法
- 公共のインターネットからスクレイピングされた事前学習データおよびアノテーターからのフィードバックデータを収集・ライセンスする国家的公共データ信託を設立する。
- 商業的モデル開発者が信託のデータにアクセスする代わりに、展開収益の一定割合を信託に支払う収益分配モデルを実装する。
- 暗号的証明、データルートトレース、第三者監査を用いた検証制度を構築し、開発者が信託のデータのみを用いることを保証する。
- 規制インcentive(例:データガバナンス法の遵守)、ポジティブインcentive(例:優先的アクセス、認証)、技術的強制力の組み合わせにより、導入を促進する。
- 既存のデータスターリングおよびコンピューティングガバナンスの取り組みと整合性を持たせ、信託を包括的なAIガバナンスフレームワークに統合する。
- 信託を公共財提供者として位置づけ、持続可能なデータ生成と長期的デジタル・コモンズの保護を支援する。
実験結果
リサーチクエスチョン
- RQ1公共的データ信託は、民間企業が支配する学習データの制御を回復し、民主的監視を回復できるか。
- RQ2モデル開発者が信託のデータのみを用いることを保証するメカニズムは何か。また、コンプライアンスはどのように検証できるか。
- RQ3データ信託はどのように持続可能な資金を確保し、AIによって生み出された価値を公平に再分配できるか。
- RQ4国家的公共データ信託は、AI展開の負の外部効果を緩和する上で果たす役割は何か。
- RQ5データ信託は、既存のデータガバナンスおよびコンピューティングガバナンスフレームワークとどのように共存し、補完的役割を果たせるか。
主な発見
- 公共的データ信託は、デジタル・コモンズの回復とAI開発からの経済的価倜の再分配を実現する実用的な制度的メカニズムとして機能しうる。
- 暗号的証明やデータルートトレースといった検証メカニズムは、モデル開発者が信託ライセンスデータのみを用いることを効果的に保証できる。
- 収益分配モデルは、AI展開から得られる利益を一般に再分配する直接的なチャネルを提供し、外部効果の是正と正義の実現に貢献する。
- 本信託モデルは、規制整合性、認証の利点、高品質データへの優先的アクセスといったインcentiveを通じて、コンプライアンスを促進する。
- 提案された信託は、学習データの生成を公共財として支援し、デジタル・コモンズの劣化リスクを低減し、長期的な持続可能性を高める。
- 信託は、特にデータスターリングおよびコンピューティングガバナンス分野で既存のガバナンスフレームワークと補完的であり、国家的AI政策にスケーラブルなモデルを提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。