Skip to main content
QUICK REVIEW

[论文解读] When Humans and Machines Make Joint Decisions: A Non-Symmetric Bandit Model.

Sebastian Bordt, Ulrike von Luxburg|arXiv (Cornell University)|Jul 9, 2020
Reinforcement Learning in Robotics参考文献 7被引用 4
一句话总结

本文提出一种非对称多臂赌博机模型,以形式化人类与机器在医疗等高风险场景下的决策协作,特别是在医生使用机器助手的情境中。研究发现,在无假设条件下,探索本质上具有困难性;然而,在策略空间独立性的假设下,双方可独立探索,从而解决联合学习中的协调问题。

ABSTRACT

How can humans and machines learn to make joint decisions? This has become an important question in domains such as medicine, law and finance. We approach the question from a theoretical perspective and formalize our intuitions about human-machine decision making in a non-symmetric bandit model. In doing so, we follow the example of a doctor who is assisted by a computer program. We show that in our model, exploration is generally hard. In particular, unless one is willing to make assumptions about how human and machine interact, the machine cannot explore efficiently. We highlight one such assumption, policy space independence, which resolves the coordination problem and allows both players to explore independently. Our results shed light on the fundamental difficulties faced by the interaction of humans and machines. We also discuss practical implications for the design of algorithmic decision systems.

研究动机与目标

  • 形式化医疗、法律和金融等高风险领域中人类与机器联合决策的动态过程。
  • 识别人类-机器协作中高效探索的根本理论障碍。
  • 分析交互假设如何影响人类与机器代理之间探索的协调性。
  • 提出双方可在不损害学习效率的前提下独立探索的条件。
  • 为支持有效人机协同的算法决策系统设计提供指导。

提出的方法

  • 将人机交互形式化为非对称多臂赌博机模型,其中人类与机器在角色和信息获取上存在不对称性。
  • 将人类建模为探索能力有限的决策者,将机器建模为潜在能力更强但受约束的学习者。
  • 引入“策略空间独立性”作为结构假设,以解耦两个代理的探索策略。
  • 分析在不同交互与信息共享假设下,联合学习过程的收敛性与遗憾性质。
  • 通过理论分析比较对称与非对称设置下,以及有无协调假设下的学习效率。
  • 证明:若缺乏策略空间独立性,由于协调失败,机器无法实现高效探索。

实验结果

研究问题

  • RQ1在人机决策系统中,高效探索的根本挑战是什么?
  • RQ2人类与机器决策能力的不对称性如何影响学习效率?
  • RQ3在何种条件下,人类与机器代理可无需协调而独立探索?
  • RQ4为解决联合探索中的协调问题,需要哪些结构性假设?
  • RQ5策略空间独立性如何在非对称赌博机设置中促进更有效的联合学习?

主要发现

  • 除非对交互结构做出特定假设,否则在人机系统中探索本质上具有困难性。
  • 在无假设条件下,由于决策角色不对称导致的协调问题,机器无法实现高效探索。
  • 策略空间独立性的假设可解决协调问题,使双方能够独立探索。
  • 在策略空间独立性假设下,人类与机器均可实现高效学习,且无需在探索过程中进行显式协调。
  • 该模型强调,现实世界中的算法决策系统必须基于对人机交互的结构性假设进行设计,以支持可扩展的学习。
  • 研究结果表明,当前的人机系统往往因未建模的协调约束而无法充分发挥联合学习的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。