Skip to main content
QUICK REVIEW

[論文レビュー] Agents and Devices: A Relative Definition of Agency

Laurent Orseau, Simon McGregor McGill|arXiv (Cornell University)|May 31, 2018
Reinforcement Learning in Robotics参考文献 14被引用数 8
ひとこと要約

この論文は、観察された行動に基づいて、システムが「エージェント」(目的最適化)か「デバイス」(入出力マッピング)かを形式的に評価するベイジアンフレームワークを提案する。エージェントには逆強化学習を、デバイスには系列予測を適用し、ベイズの定理により事後確率を計算することで、目的切り替え行動や非最適な軌道でさえも、適切な事前分布を用いればエージェント的と解釈可能であることを示している。

ABSTRACT

According to Dennett, the same system may be described using a `physical' (mechanical) explanatory stance, or using an `intentional' (belief- and goal-based) explanatory stance. Humans tend to find the physical stance more helpful for certain systems, such as planets orbiting a star, and the intentional stance for others, such as living animals. We define a formal counterpart of physical and intentional stances within computational theory: a description of a system as either a device, or an agent, with the key difference being that `devices' are directly described in terms of an input-output mapping, while `agents' are described in terms of the function they optimise. Bayes' rule can then be applied to calculate the subjective probability of a system being a device or an agent, based only on its behaviour. We illustrate this using the trajectories of an object in a toy grid-world domain.

研究の動機と目的

  • 計算システムにおけるエージェントとデバイスの観察者相対的な区別を形式化すること。
  • 観察された行動に基づいて、システムがエージェントまたはデバイスであるという主観的確率を計算する手法を開発すること。
  • 多様な行動軌道(目的切り替えや反応的行動を含む)を含むグリッドワールド領域で、アプローチの妥当性を検証すること。
  • 目的が変化しても、適切な事前分布を用いてモデル化すれば代理行動が維持可能であることを示すこと。
  • AIおよび強化学習研究に適した人間中心ではない形式的代理行動定義を提供すること。

提案手法

  • システムの行動を時間経過に伴う入出力ペアの系列 (x_t, y_t) としてモデル化する。
  • 機械的行動をモデル化するため、各関数 d に事前重み w_d を割り当てた入出力関数の重み付き和としてデバイス混合モデル M_d を定義する。
  • 観察された行動から最も可能性の高い目的と ε-greedy 方策を逆強化学習により推定することで、エージェント混合モデル M_a を定義する。
  • ベイズの定理を適用し、観察された軌道 yx_{1:T} のもとでシステムがエージェントであるという事後確率 P(M_a | yx_{1:T}) を計算する。
  • デバイスモデルとエージェントモデルの両方における軌道の対数尤度を比較し、どちらの説明がより妥当であるかを判断する。
  • 目的切り替えを許容するためのスイッチング目的事前分布モデルを用い、複雑な軌道の適合性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1システムの行動が、エージェント的(目的最適化)であるか、デバイス的(機械的入出力マッピング)であるかを、形式的にどの程度定量的に評価できるか。
  • RQ2システムが目的切り替え行動を示しても、依然としてエージェントとして分類可能である範囲はどこか。このような行動はどのようにモデル化すべきか。
  • RQ3壁沿い走行、ランダム移動、非最適な目的到達など、異なる行動パターンが、デバイスモデルとエージェントモデルの両方において、どの程度尤もらしいかを比較するとどうなるか。
  • RQ4観察された軌道のみを用いて、真にエージェント的行動と反応的で目的指向でない行動を区別できるか。
  • RQ5観察者の事前知識が代理行動の事後確率にどの程度影響を与えるか。これは計算的に実行可能なかたちで形式化可能か。

主な発見

  • グリッドワールド領域において、このフレームワークはデバイス的行動とエージェント的行動を効果的に区別できた。壁沿い走行のような軌道はデバイスとして、目的指向的な経路はエージェントとしてよりよく説明された。
  • 非最適な経路をたどるが目的指向の行動は、特にスイッチング目的事前分布を用いることで、デバイスモデルよりもエージェントモデルの下で尤もらしい。
  • ランダム行動は両モデルにおいて高い負の対数尤度(NLL)を示し、いずれの説明に対しても適合が悪いことを示しており、明確な代理行動やメカニズムの欠如と整合的である。
  • マゼンタの風船から緑の風船へと目的を切り替えるような場合、スイッチング事前分布を備えたエージェントモデルは、非スイッチングモデルよりも顕著に高い適合度を示し、事前分布構造の重要性を示している。
  • 行動が目的指向的で一貫している場合、非最適であっても代理行動の事後確率は上昇し、反応的またはランダムな行動では低下する。
  • モデルは、目的切り替えがまれでかつ事前分布に明示的に組み込まれている限り、システムが目的切り替えを経てもエージェントとしての資質を維持できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。