Skip to main content
QUICK REVIEW

[論文レビュー] When Humans and Machines Make Joint Decisions: A Non-Symmetric Bandit Model.

Sebastian Bordt, Ulrike von Luxburg|arXiv (Cornell University)|Jul 9, 2020
Reinforcement Learning in Robotics参考文献 7被引用数 4
ひとこと要約

本稿では、医療分野における医師と機械アシスタントの間の意思決定を形式化する非対称バンディットモデルを提案する。探索は仮定がなければ根本的に困難であることが示されるが、ポリシー空間の独立性という仮定のもとでは、両者ともに独立して探索でき、共同学習における調整問題が解決される。

ABSTRACT

How can humans and machines learn to make joint decisions? This has become an important question in domains such as medicine, law and finance. We approach the question from a theoretical perspective and formalize our intuitions about human-machine decision making in a non-symmetric bandit model. In doing so, we follow the example of a doctor who is assisted by a computer program. We show that in our model, exploration is generally hard. In particular, unless one is willing to make assumptions about how human and machine interact, the machine cannot explore efficiently. We highlight one such assumption, policy space independence, which resolves the coordination problem and allows both players to explore independently. Our results shed light on the fundamental difficulties faced by the interaction of humans and machines. We also discuss practical implications for the design of algorithmic decision systems.

研究の動機と目的

  • 医療、法曹、金融などハイリスク分野における人間と機械の共同意思決定のダイナミクスを形式化すること。
  • 人間と機械の協働における効率的探索の根本的理論的障壁を特定すること。
  • 相互作用の仮定が人間と機械のエージェント間の探索の調整にどのように影響するかを分析すること。
  • 両エージェントが明示的な調整を伴わずに独立して探索できる条件を提案すること。
  • 効果的な人間と機械の連携を支援するアルゴリズム的意思決定システムの設計を支援すること。

提案手法

  • 人間と機械が非対称な役割と情報アクセスを持つ非対称的マルチアームバンディットとして人間と機械の相互作用を形式化する。
  • 人間を制限された探索能力を持つ意思決定者としてモデル化し、機械をより能力が高くても制限のある学習者としてモデル化する。
  • ポリシー空間の独立性という構造的仮定を導入し、2つのエージェントの探索戦略を分離する。
  • 相互作用と情報共有に関する異なる仮定の下で、共同学習プロセスの収束性とレグレット特性を分析する。
  • 理論的分析を用いて、対称的対比非対称的設定および調整の有無の下での学習効率を比較する。
  • ポリシー空間の独立性がなければ、調整不能性に起因するため、機械は効率的に探索できないことを示す。

実験結果

リサーチクエスチョン

  • RQ1人間と機械の意思決定システムにおける効率的探索の根本的課題は何であるか?
  • RQ2人間と機械の意思決定能力の非対称性が学習効率にどのように影響するか?
  • RQ3人間と機械の両者が調整のオーバーヘッドを伴わずに独立して探索できる条件は何か?
  • RQ4共同探索における調整問題を解消するために必要な構造的仮定は何か?
  • RQ5ポリシー空間の独立性は、非対称バンディット設定におけるより効果的な共同学習をどのように可能にするか?

主な発見

  • 相互作用構造に関する特定の仮定がなければ、人間と機械のシステムにおける探索は根本的に困難である。
  • 仮定がなければ、非対称な意思決定役割に起因する調整問題により、機械は効率的に探索できない。
  • ポリシー空間の独立性という仮定が調整問題を解消し、両エージェントが独立して探索できるようにする。
  • ポリシー空間の独立性のもとでは、人間と機械の両方が明示的な調整を伴わずに効率的な学習を達成できる。
  • このモデルは、現実世界のアルゴリズム的意思決定システムが、スケーラブルな学習を支援するための、人間と機械の相互作用に関する構造的仮定を備えるべきであることを示唆する。
  • 結果から、現在の多くの人間と機械のシステムは、モデル化されていない調整制約のため、共同学習の潜在能力を十分に活用できていない可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。