[論文レビュー] Tournesol: A quest for a large, secure and trustworthy database of reliable human judgments
Tournesolは、大規模で安全かつ信頼できるコンテンツ品質に関する人間の判断のデータベースを構築するオープンソースプラットフォームを提案している。このシステムは、分散型かつプライバシー保護型のアプローチを用いて、倫理的な推薦およびモデレーションアルゴリズムの訓練を可能にする。集団による人間の評価をブラッドリー・テリー・モデルを用いて処理し、強固でスケーラブルかつ信頼できるスコアを生成する。その目的は、AIを社会的価値と一致させる基盤的リソースを提供することにある。
Today's large-scale algorithms have become immensely influential, as they recommend and moderate the content that billions of humans are exposed to on a daily basis. They are the de-facto regulators of our societies' information diet, from shaping opinions on public health to organizing groups for social movements. This creates serious concerns, but also great opportunities to promote quality information. Addressing the concerns and seizing the opportunities is a challenging, enormous and fabulous endeavor, as intuitively appealing ideas often come with unwanted {\it side effects}, and as it requires us to think about what we deeply prefer. Understanding how today's large-scale algorithms are built is critical to determine what interventions will be most effective. Given that these algorithms rely heavily on {\it machine learning}, we make the following key observation: \emph{any algorithm trained on uncontrolled data must not be trusted}. Indeed, a malicious entity could take control over the data, poison it with dangerously manipulative fabricated inputs, and thereby make the trained algorithm extremely unsafe. We thus argue that the first step towards safe and ethical large-scale algorithms must be the collection of a large, secure and trustworthy dataset of reliable human judgments. To achieve this, we introduce \emph{Tournesol}, an open source platform available at \url{https://tournesol.app}. Tournesol aims to collect a large database of human judgments on what algorithms ought to widely recommend (and what they ought to stop widely recommending). We outline the structure of the Tournesol database, the key features of the Tournesol platform and the main hurdles that must be overcome to make it a successful project. Most importantly, we argue that, if successful, Tournesol may then serve as the essential foundation for any safe and ethical large-scale algorithm.
研究の動機と目的
- 制御不能なデータに駆動される信頼性の低い大規模な推薦およびモデレーションアルゴリズムが引き起こす社会的リスクの増大に対処すること。
- 倫理的なAI開発の基盤として、大規模で安全かつ信頼できる人間の判断のデータベースを確立すること。
- ジャーナリストや公衆衛生担当者などの中間的で社会的役割を果たす団体が、スケーラブルで透明性があり、説明責任のあるアルゴリズム的判断ツールを提供されること。
- 機械学習におけるデータ汚染、操作、バイアスのリスクを低減すること。そのために、人間が検証済みの信頼できる判断に基づいてアルゴリズムを基盤化すること。
- 言語モデルや推薦エンジンを含む、強固に有益で人間の価値観と一致する倫理的なAIシステムの構築を可能にすること。
提案手法
- プラットフォームは、コンテンツの対比較を計算するために二項ブラッドリー・テリー・モデルを用い、人間の評価をスケーラブルで正規化されたスコアに変換する。
- 貢献者は匿名でコンテンツのペアを評価することで、プライバシーを確保し、個人の好みによるバイアスを低減する。
- システムは分散型に設計されており、将来的には貢献者のデバイスにデータと計算を格納することで、単一障害点を回避することを目的としている。
- Tournesolは、データ整合性とプライバシーを保証するため、ゼロ知識証明や検証可能秘匿共有といった暗号技術を採用している。
- 将来的には、動画メタデータへの自然言語処理(NLP)の統合を支援し、未評価のコンテンツに対しても評価を一般化することでスケーラビリティを向上させる。
- ユーザーごとに複数のローカル学習モデルを可能にすることで、個人のカスタマイズを実現しながらも、プライバシーや信頼性を保持する。
実験結果
リサーチクエスチョン
- RQ1大規模で安全かつ信頼できる人間の判断のデータベースを、どのように大規模に収集・維持できるか?
- RQ2分散型人間判断システムにおいて、プライバシーとビザンチン耐性を保証する技術的・暗号的手法は何か?
- RQ3メタデータやNLPを用いて、まだ評価のないコンテンツに対して人間の判断をどの程度一般化できるか?
- RQ4Tournesolのデータベースは、大規模言語モデルの出力を倫理的かつ社会的に有益なものに一致させるために、どのように活用できるか?
- RQ5人間の判断に基づく目的関数の最適化において、グッドハートの法則と報酬ハッキングを防ぐために最も効果的な方法は何か?
主な発見
- Tournesolは、https://tournesol.app に機能するオープンソースプラットフォームを正常にローンチし、コンテンツ品質に関する人間の判断を収集・キュレーションしている。
- プラットフォームは、二項ブラッドリー・テリー・モデルを用いて、対比較の人間評価を正規化され、スケーラブルなスコアに変換しており、集団的判断を反映している。
- Tournesolは、ゼロ知識証明や検証可能秘匿共有のサポートを含む、強固なプライバシー保証を備えており、貢献者の保護とデータ汚染の防止を図っている。
- プロジェクトは、分散型の長期的目標を明確にしている。現在、完全にビザンチン耐性のある分散型学習システムの研究が進行中である。
- Tournesolは、動画の説明文やメタデータに対するNLPを用いた将来的な評価一般化を可能としているが、これには現在のデータセットよりも大きなデータセットが必要である。
- プラットフォームは、特に推薦およびモデレーションシステムにおけるAIのアライメント問題を解決する基盤的リソースとして位置づけられており、目的関数を人間が検証済みの価値に基づいて基盤化することで実現している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。