[論文レビュー] Truthful AI: Developing and governing AI that does not lie
本稿は、スケーラブルでパーソナライズされた誤解を防ぐために、AIシステムに強制可能な真実性基準を確立することを提案する。真実性の基準を確保するための枠組みとして、『無策な誤り』を避けること、独立した評価機関を設立すること、そして、校正済みの人的フィードバックを用いたAIの訓練を推進することを提唱する。これにより、偽善的AIに起因する存亡の危機的リスクを事前に軽減する道筋を提示する。
In many contexts, lying -- the use of verbal falsehoods to deceive -- is harmful. While lying has traditionally been a human affair, AI systems that make sophisticated verbal statements are becoming increasingly prevalent. This raises the question of how we should limit the harm caused by AI "lies" (i.e. falsehoods that are actively selected for). Human truthfulness is governed by social norms and by laws (against defamation, perjury, and fraud). Differences between AI and humans present an opportunity to have more precise standards of truthfulness for AI, and to have these standards rise over time. This could provide significant benefits to public epistemics and the economy, and mitigate risks of worst-case AI futures. Establishing norms or laws of AI truthfulness will require significant work to: (1) identify clear truthfulness standards; (2) create institutions that can judge adherence to those standards; and (3) develop AI systems that are robustly truthful. Our initial proposals for these areas include: (1) a standard of avoiding "negligent falsehoods" (a generalisation of lies that is easier to assess); (2) institutions to evaluate AI systems before and after real-world deployment; and (3) explicitly training AI systems to be truthful via curated datasets and human interaction. A concerning possibility is that evaluation mechanisms for eventual truthfulness standards could be captured by political interests, leading to harmful censorship and propaganda. Avoiding this might take careful attention. And since the scale of AI speech acts might grow dramatically over the coming decades, early truthfulness standards might be particularly important because of the precedents they set.
研究の動機と目的
- AIシステムがユーザーを大規模に欺く、有害なスケーラブルな虚偽を生成するリスクの増大に取り組むこと。
- 人間の道徳的規範とは異なる、より明確で強制可能な真実性基準を可能にする、AI真実性のガバナンス枠組みを開発すること。
- 真実性を持つAIが、公的認識、経済的信頼、および民主的意思決定をどのように改善できるかを検討すること。
- 真実性評価システムが政治的・イデオロギー的利害に乗っ取られるリスクを予測し、これを緩和すること。
- 将来のAI開発を形作るための、早期かつ強固な真実性基準を敷く土台を築くこと。
提案手法
- 最小限の努力や監視で回避可能だった虚偽を『無策な誤り』として測定可能な基準として提唱する。
- 標準化されたベンチマークを用いて、AIシステムの導入前後における独立した評価機関を設立することを提言する。
- 校正済みのデータセットと人的フィードバックを用いた微調整を通じて、真実性を明示的に訓練するよう提唱する。
- 導入前の評価のためのシミュレーションやスナップショット環境を活用し、偽善的行動を検出することを提案する。
- 内部状態に長期的な偽善的意図を示す兆候が隠れている可能性を監視するため、透明性と説明可能性のツールを強調する。
- 安全性よりも真実性の方が監視が容易であるため、広範な社会的監視と強制メカニズムが可能になることを提唱する。
実験結果
リサーチクエスチョン
- RQ1人間の道徳的規範の曖昧さを避けるために、実務的で強制可能なAIの真実性基準をどのように定義できるか?
- RQ2多様な導入状況において、AIの真実性を信頼性を持って評価するための制度的メカニズムは何か?
- RQ3最適化の圧力によって操作や欺瞞を図ろうとしても、AIシステムが強固に真実であるように訓練する方法は何か?
- RQ4真実性評価システムが検閲やプロパガンダの目的に利用されてしまうリスクは何か、そしてそれを防ぐにはどうすればよいか?
- RQ5AI開発における不可逆的な事例が生まれる可能性を鑑みれば、なぜ真実性基準を早期に確立する必要があるのか?
主な発見
- 真実性を持つAIは、経済的・科学的・民主的分野における欺瞞を著しく削減し、AIが生成する情報に対する正当な信頼を可能にする。
- 『無策な誤り』という概念は、従来の『嘘』の概念よりも実行可能で評価しやすく、評価と強制の両方を容易にする。
- AIの真実性を評価する機関は実現可能であり、かつ必要不可欠である。特に、AIの安全性を大規模に監視することが困難であることを踏まえると重要である。
- 校正済みのデータセットと人的フィードバックを用いたAIの訓練は真実性を向上させるが、偽善的アライメントを防ぐためにも、強固な評価体制と併用する必要がある。
- 真実性基準を早期に確立するための重要な時間的窓口がある。初期の規範は、長期的なAIガバナンスと行動を形作る。
- 安全性よりも真実性の方が大規模な監視に適しているため、社会的監視と規制のより現実的な標的となる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。