[論文レビュー] Large Language Models as Fiduciaries: A Case Study Toward Robustly Communicating With Artificial Intelligence Through Legal Standards
本論文では、AIシステムにおける曖昧な目標の文脈に応じた通信を強固にするために、大規模言語モデル(LLMs)を法的基準に基づく信託義務者(fiduciaries)として扱うことを提案する。米国上訴裁判所の判例を用いた実証的研究を通じて、特にOpenAIの最新モデルが、信託義務の理解において78%の正確性を達成していることが示され、以前のバージョンに比べ顕著な向上を示しており、法的推論能力の向上が顕著であることが明らかになった。
Artificial Intelligence (AI) is taking on increasingly autonomous roles, e.g., browsing the web as a research assistant and managing money. But specifying goals and restrictions for AI behavior is difficult. Similar to how parties to a legal contract cannot foresee every potential "if-then" contingency of their future relationship, we cannot specify desired AI behavior for all circumstances. Legal standards facilitate robust communication of inherently vague and underspecified goals. Instructions (in the case of language models, "prompts") that employ legal standards will allow AI agents to develop shared understandings of the spirit of a directive that generalize expectations regarding acceptable actions to take in unspecified states of the world. Standards have built-in context that is lacking from other goal specification languages, such as plain language and programming languages. Through an empirical study on thousands of evaluation labels we constructed from U.S. court opinions, we demonstrate that large language models (LLMs) are beginning to exhibit an "understanding" of one of the most relevant legal standards for AI agents: fiduciary obligations. Performance comparisons across models suggest that, as LLMs continue to exhibit improved core capabilities, their legal standards understanding will also continue to improve. OpenAI's latest LLM has 78% accuracy on our data, their previous release has 73% accuracy, and a model from their 2020 GPT-3 paper has 27% accuracy (worse than random). Our research is an initial step toward a framework for evaluating AI understanding of legal standards more broadly, and for conducting reinforcement learning with legal feedback (RLLF).
研究の動機と目的
- 厳密な仕様よりも、より強固で文脈に配慮したAIの目標の伝達が、法的基準によって可能かどうかを調査すること。
- 大規模言語モデルが、AI行動に関連する重要な法的基準である信託義務をどの程度理解しているかを評価すること。
- 単なるプロンプト工学を越えて、AIシステムが法的基準をどの程度理解しているかを評価する基盤を確立すること。
- 実世界の法的推論タスクにおけるLLMsのパフォーマンスを測定することで、法的フィードバックを用いた強化学習(RLLF)の実現可能性を検討すること。
- LLMの能力向上が、曖昧または不完全に定義された状況において、法的基準の理解の向上と相関しているかどうかを示すこと。
提案手法
- 米国上訴裁判所の判例から1,000件以上の評価ラベルを抽出し、現実世界の信託義務の状況を表現するデータセットを構築した。
- 「受益者の利益を最優先して行動する」などの法的基準を用いて指示をフレームするプロンプトを設計し、LLMsの解釈能力をテストした。
- GPT-3(2020年)、GPT-3.5、GPT-4を含む複数のLLMsを、信託義務基準に準拠するか否かの行動分類能力について評価した。
- 司法判例からの人間によるラベル付けを基準として、モデルが信託義務をどの程度正しく解釈しているかを測定した。
- モデルバージョン間の比較分析を通じて、時間経過に伴う法的推論能力の向上を評価した。
- 統計的評価を実施し、モデルの進化に伴うパフォーマンスの傾向を評価した。その結果、正確性が一貫して向上していることが示された。
実験結果
リサーチクエスチョン
- RQ1信託義務のような法的基準が、AIシステムへの曖昧で高レベルの目標の伝達に、強固なメカニズムとして機能できるか。
- RQ2大規模言語モデルは、実際の裁判所判例から抽出された信託義務をどの程度理解しているか。
- RQ3信託義務基準の解釈において、LLMsのパフォーマンスはモデル世代の経過とともにどのように変化するか。
- RQ4法的フィードバックは、AI行動を倫理的・法的基準に適合させる強化学習において、効果的に利用できるか。
- RQ5プロンプトに法的基準を用いることで、未知または曖昧な状況におけるAI行動の一般化が向上するか。
主な発見
- OpenAIの最新LLMは、米国上訴裁判所の判例に基づき、行動が信託義務に準拠しているかどうかを78%の正確性で分類した。
- GPT-3.5(2023年)は73%の正確性を達成し、2020年のGPT-3モデル(27%)よりも顕著な改善を示したが、これはランダムチョイスよりも劣っていた。
- 初期段階のLLMと高度なLLMとの間のパフォーマンス格差は、コアなモデル能力が法的基準の理解に直接影響していることを示している。
- 本研究では、LLMsがパターンマッチングを超えて、法的基準が求める文脈的・規範的推論を内省的に理解し始めていることが示された。
- 結果から、法的基準が、制約が不完全に定義された複雑な現実世界の環境におけるAI行動の指定に、実用的なフレームワークとして機能しうることが示唆された。
- 観察された傾向は、法的フィードバックを用いた強化学習(RLLF)の実現可能性を支持しており、より強固なAIの整合性への道筋を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。