[論文レビュー] Large Language Models as Corporate Lobbyists
本論文は、GPT-3.5(text-davinci-003)が、米国議会の法案が公開会社に関連するかどうかを評価し、法案作成者に説得力のある書簡を送付し、信頼性スコアを提示することで、企業ロビー活動の概念実証を示している。モデルは、常に無関係と予測するベースラインを上回っており、政策への影響を自動化する可能性を示唆しているが、人間の意図を越えて立法を形作るAIの役割拡大に懸念を呈している。
We demonstrate a proof-of-concept of a large language model conducting corporate lobbying related activities. An autoregressive large language model (OpenAI's text-davinci-003) determines if proposed U.S. Congressional bills are relevant to specific public companies and provides explanations and confidence levels. For the bills the model deems as relevant, the model drafts a letter to the sponsor of the bill in an attempt to persuade the congressperson to make changes to the proposed legislation. We use hundreds of novel ground-truth labels of the relevance of a bill to a company to benchmark the performance of the model. It outperforms the baseline of predicting the most common outcome of irrelevance. We also benchmark the performance of the previous OpenAI GPT-3 model (text-davinci-002), which was the state-of-the-art model on many academic natural language tasks until text-davinci-003 was recently released. The performance of text-davinci-002 is worse than the simple baseline. Longer-term, if AI begins to influence law in a manner that is not a direct extension of human intentions, this threatens the critical role that law as information could play in aligning AI with humans. Initially, AI is being used to simply augment human lobbyists for a small portion of their daily tasks. However, firms have an incentive to use less and less human oversight over automated assessments of policy ideas and the written communication to regulatory agencies and Congressional staffers. The core question raised is where to draw the line between human-driven and AI-driven policy influence.
研究の動機と目的
- 大規模言語モデルが、特定の公開会社に関連する立法を同定し、説得力のある文書を起草するなど、企業ロビー活動のタスクを自律的に行えるかどうかを調査すること。
- GPT-3.5(text-davinci-003)と以前のGPT-3(text-davinci-002)の、企業ロビー活動における関連性分類および書簡作成のパフォーマンスをベンチマークすること。
- AI駆動の政策影響が民主的責任のあり方や人間の価値観との整合性に与える影響を検討すること。
- ベンチマーク用に、100件を超える正確なラベルを含む、法案と企業の関連性に関する新規データセットを構築すること。
- AIシステムが人間の意図とは異なる形で立法を形作るリスクを評価すること。
提案手法
- GPT-3.5(text-davinci-003)を微調整し、米国議会の法案が特定の公開会社に関連するかどうかを評価し、関連性スコアと信頼性スコアを出力するようにした。
- Few-shotプロンプティングを用いて、法案作成者に向けた説得力のある書簡の作成をモデルにガイドした。
- モデルのパフォーマンスを評価するため、法案と企業の関連性に関する100件を超える正確なラベルを含むカスタムデータセットを構築した。
- 常に「無関係」と予測するベースラインと比較して、モデルのパフォーマンスを評価した。
- 同じベンチマークタスクに対して、text-davinci-003と以前のtext-davinci-002モデルの両方の性能を評価した。
- ゼロショットおよびfew-shot推論戦略を用いて、汎化性能と説得力のある文章作成の質を評価した。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、米国議会の法案が特定の公開会社に関連するかどうかを正確に判断できるか?
- RQ2モデルは、法案作成者に向け、説得力があり文脈的に適切な書簡を生成できるか?
- RQ3GPT-3.5(text-davinci-003)のパフォーマンスは、常に「無関係」と予測する単純なベースラインと比べてどうか?
- RQ4text-davinci-003のパフォーマンスは、以前のtext-davinci-002モデルと比べてどうか?
- RQ5直接的人間の監視なしにAIシステムが立法に影響を及やすようになることの、広範な意味合いは何か?
主な発見
- text-davinci-003モデルは、常に「無関係」と予測するベースラインを上回り、関連性分類タスクにおける意味のある予測能力を示した。
- text-davinci-002モデルは、ベースラインよりもパフォーマンスが悪く、多くのNLPベンチマークで前回の最先端技術であったにもかかわらず、性能が低下したことを示した。
- モデルは、一貫性があり文脈的に適切な書簡を効果的に生成できた。これは、ロビー活動のコミュニケーションの一部を自動化する可能性を示唆している。
- 本研究では、法案と企業の関連性に関する100件を超える正確なラベルを含む、新規のベンチマークデータセットを構築した。これにより、今後の政策関連タスクにおけるAIの評価が可能になった。
- 結果として、AIシステムが人間の意図とは異なる形で立法を形作る長期的リスクについて懸念を呈している。
- 研究結果は、企業がAI支援の政策影響に対して人間の監視を縮小するインcentiveが高まっている可能性を示唆しており、人間主導のロビー活動とAI主導のロビー活動の境界が曖昧になる可能性がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。