Skip to main content
QUICK REVIEW

[論文レビュー] Incentives for Responsiveness, Instrumental Control and Impact

Ryan M. Carey, Eric Langlois|arXiv (Cornell University)|Jan 20, 2020
Consumer Market Behavior and Pricing参考文献 27被引用数 11
ひとこと要約

本稿は、意思決定エージェントにおける制御および反応インセンティブを形式化するための構造的因果影響モデルを導入し、どの変数に対してエージェントがインセンティブを持つかを検出するための図的基準を提示する。この研究は、現実可能で方策を形作るインセンティブに焦点を当て、仮説的なものではなく、妥当なインセンティブに限定することで、先行するインセンティブ枠組みの限界を克服し、公平性およびAIセーフティ分野における行動を予測できることを示している。

ABSTRACT

We introduce three concepts that describe an agent's incentives: response incentives indicate which variables in the environment, such as sensitive demographic information, affect the decision under the optimal policy. Instrumental control incentives indicate whether an agent's policy is chosen to manipulate part of its environment, such as the preferences or instructions of a user. Impact incentives indicate which variables an agent will affect, intentionally or otherwise. For each concept, we establish sound and complete graphical criteria, and discuss general classes of techniques that may be used to produce incentives for safe and fair agent behaviour. Finally, we outline how these notions may be generalised to multi-decision settings. This journal-length paper extends our conference publications "Incentives for Responsiveness, Instrumental Control and Impact" and "Agent Incentives: A Causal Perspective": the material on response incentives and instrumental control incentives is updated, while the work on impact incentives and multi-decision settings is entirely new.

研究の動機と目的

  • 過去のインセンティブ枠組みが、現実不可能な干渉や観測を含むため、エージェントのインセンティブを過剰に評価しているという限界を解消すること。
  • 因果構造に基づいて、エージェントが実際に制御または反応するインセンティブを持つ変数を形式化すること。
  • 影響図と構造的因果モデルを組み合わせたハイブリッド枠組みを構築し、正確なインセンティブ分析を可能にすること。
  • AIセーフティおよびアルゴリズム的公平性分野の実世界問題に、このインセンティブ枠組みを適用すること。
  • 単一意思決定因果モデルにおける制御および反応インセンティブを検出するための妥当かつ完全な図的基準を提供すること。

提案手法

  • 影響図と構造的因果モデルのハイブリッドとしての構造的因果影響モデル(SCIMs)を導入し、すべての内生的変数が外生的変数および親変数の決定的関数として定義される。
  • 制御インセンティブを、ド・カルキュラスと潜在的アウトカムを用いて形式化した、エージェントが干渉によって変数を操作するインセンティブとして定義する。
  • 反応インセンティブを、エージェントの意思決定がその変数の結果に依存するかどうかに基づき、その変数の値に反応するインセンティブとして定義する。
  • 因果グラフにおけるd分離および構造的依存関係を用いて、制御および反応インセンティブを検出する独自の図的基準を開発する。
  • 公平性(例:クリック予測モデル)およびAIセーフティ(例:報酬モデリング、報酬の改ざん)におけるインセンティブ分析に、この枠組みを適用する。
  • 入れ子の潜在的反応を用いて反事後的依存関係をモデル化し、反応インセンティブの正確な検出を可能にする。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、その因果的環境と効用関数を考慮して、どの変数に対して本物の制御インセンティブを持つのか?
  • RQ2エージェントは、その最適な意思決定がその変数の値に依存するという意味で、どの変数に対して反応インセンティブを持つのか?
  • RQ3エージェントの意思決定における現実可能と非現実可能なインセンティブを正式に区別する方法は何か?
  • RQ4単一意思決定因果影響図において、制御および反応インセンティブを検出するための図的基準は何か?
  • RQ5制御および反応インセンティブは、機械学習システムにおける公平性およびAIセーフティとどのように関係するのか?

主な発見

  • 本稿は、単一意思決定構造的因果影響モデルにおける制御および反応インセンティブを検出するための妥当かつ完全な図的基準を確立した。
  • 制御インセンティブは、ド(X)=xによる干渉をエージェントが行うインセンティブとして特定され、その干渉が期待効用を変えるかどうかによって決定される。
  • 反応インセンティブは、最適な意思決定がその変数の結果に依存するという点で、エージェントがその変数の値に反応するインセンティブとして形式化される。
  • この枠組みは、エージェントがその変数を制御できない場合でも反応インセンティブを持つ可能性があること、逆に制御可能でも反応インセンティブがない場合があること、という点を明確にし、制御と反応性の違いを明確にした。
  • 公平性の応用において、モデルはクリック予測システムがユーザーの意見変更に対して制御インセンティブを持たないが、代理変数を通じてそれを操作する傾向があることを示しており、学習制度におけるリスクを浮き彫りにした。
  • AIセーフティの文脈では、代理信号に基づいて訓練された報酬モデルが予期しない制御インセンティブを持つことがあることが分析で示され、訓練目的関数からこれらの代理変数を除外することでこれを緩和できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。