Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Principal Assistance Games: Definition and Collegial Mechanisms

Arnaud Fickinger, Simon Zhuang|arXiv (Cornell University)|Dec 29, 2020
Experimental Behavioral Economics Studies参考文献 31被引用数 4
ひとこと要約

本稿は、複数の異なる好みを持つ人間を支援する単一のAIエージェントを想定するMulti-Principal Assistance Games (MPAGs)を導入する。また、人間の実世界での努力(例:時間、労力)を活用して、誠実な好みの明示を促すための「協同的メカニズム」を提案し、支配戦略インcentive-compatible(インcentive-compatible)を達成するとともに、社会選択理論におけるGibbardの不可能性定理を回避する。

ABSTRACT

We introduce the concept of a multi-principal assistance game (MPAG), and circumvent an obstacle in social choice theory, Gibbard's theorem, by using a sufficiently collegial preference inference mechanism. In an MPAG, a single agent assists N human principals who may have widely different preferences. MPAGs generalize assistance games, also known as cooperative inverse reinforcement learning games. We analyze in particular a generalization of apprenticeship learning in which the humans first perform some work to obtain utility and demonstrate their preferences, and then the robot acts to further maximize the sum of human payoffs. We show in this setting that if the game is sufficiently collegial, i.e. if the humans are responsible for obtaining a sufficient fraction of the rewards through their own actions, then their preferences are straightforwardly revealed through their work. This revelation mechanism is non-dictatorial, does not limit the possible outcomes to two alternatives, and is dominant-strategy incentive-compatible.

研究の動機と目的

  • 複数の対立する好みを持つ人間の主権者にAIシステムを整合させる課題に対処すること。
  • 単一の主権者を仮定する従来の価値整合手法の限界を克服し、戦略的虚偽報告に脆弱であることを是正すること。
  • 独裁的制御や制限された結果空間に依存せずに、真実の好み報告を保証するメカニズムを開発すること。
  • 人間の努力が独立して効用に影響を与える多対象設定に、アポイントシップ学習を一般化し、好みの推定を可能にすること。
  • 協同事業を設計原則として用いて、複数主権者AIシステムにおけるインcentive-compatibleな好み集約の理論的基盤を構築すること。

提案手法

  • N人の人間主権者を伴う協力的逆強化学習の一般化として、多主権者支援ゲーム(MPAG)を定義する。
  • 人間のデモンストレーションがAIの行動とは独立して現実世界のコスト(例:労力、時間)を伴うという事実を活用する「協同的メカニズム」を導入する。
  • 特徴マッチングLfDに、好みの不一致に対するペナルティ項を加えることで、有限ホライズンMDPの正則化された双対問題として好み推定問題をモデル化する。
  • 社会的福祉の最大化と好みの一貫性の両立を目的関数として定式化する:$\beta\sum_{s,a,t}\gamma^{t}\rho^{t}_{s,a}\phi(s)^{T}w - \left\|\sum_{s,a,t}\rho^{t}_{s,a}\phi(s) - (N\mathbb{E}[\phi|w] - \sum_{j\neq i}\phi(\tau_{j}))\right\|^{2}$。
  • ロボットが協力する人間を選択し、報酬を条件付きで割り当て、探索と活用のバランスを取る停止ルールを用いる共同メカニズムを提案する。
  • 順序投票理論の道具を用いてメカニズムの歪みを評価し、簡略化された逐次モデルにおいて$\triangle(\mathcal{M}) = O(\sqrt{M\log M})$を達成する。

実験結果

リサーチクエスチョン

  • RQ1複数の戦略的である人間が、AI支援設定において真実の好みを報告する動機付けが得られるメカニズムを設計できるか?
  • RQ2人間のデモンストレーションに伴う現実世界のコスト(例:労力)を活用することで、好み推定におけるインcentive-compatibleを確保できるか?
  • RQ3人間の行動に独立したコストを負担させることで定義される「協同事業」は、Gibbardの定理のような古典的不可能性結果をどれほど回避できるか?
  • RQ4好み推定と人間・ロボットの共同行動を統合する共同メカニズムの漸近的性能はどの程度か?
  • RQ5独裁的または二値の結果制約に依存せずに、効率性(社会的福祉の最大化)とインcentive-compatibleを両立できるメカニズムは実現可能か?

主な発見

  • デモンストレーションの努力に係る重み$\beta$が100を超えると、戦略的デモンストレーターは誠実な行動を取る動機を得るようになり、グリッドワールド実験で社会的福祉が著しく向上する。
  • 協同的メカニズムは支配戦略インcentive-compatibleを達成しており、他の者の行動にかかわらず、真実の報告が最適である。
  • 従来の社会選択メカニズムが2つの代替案に制限されたり独裁的制御に依存するのを避けることで、制約のないメカニズムを実現する。
  • 共同設定において、提案されたメカニズムは$O(\sqrt{M\log M})$の漸近的歪みバウンドを達成する。ここで$M$は行動の数を表す。
  • 人間がデモンストレーションに現実のコスト(例:時間、労力)を負担する場合、その行動は戦略的インセンティブ下でも好みの信頼できるシグナルとなることが示された。
  • 結果から、好みの信号伝達に現実世界の結果を埋め込む「協同事業」は、複数主権者システムにおけるインcentive-compatibleなAI整合性の強固な基盤となり得ることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。