Skip to main content
QUICK REVIEW

[论文解读] Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration

Xavier Puig, Tianmin Shu|arXiv (Cornell University)|Oct 19, 2020
Reinforcement Learning in Robotics参考文献 54被引用 40
一句话总结

WAH 引入一个两阶段挑战:AI 观察一个类似人类的代理以推断目标,然后在一个新环境中与之合作尽快完成家庭任务。它在 VirtualHome-Social 中评估社会认知和人机协作。

ABSTRACT

In this paper, we introduce Watch-And-Help (WAH), a challenge for testing social intelligence in agents. In WAH, an AI agent needs to help a human-like agent perform a complex household task efficiently. To succeed, the AI agent needs to i) understand the underlying goal of the task by watching a single demonstration of the human-like agent performing the same task (social perception), and ii) coordinate with the human-like agent to solve the task in an unseen environment as fast as possible (human-AI collaboration). For this challenge, we build VirtualHome-Social, a multi-agent household environment, and provide a benchmark including both planning and learning based baselines. We evaluate the performance of AI agents with the human-like agent as well as with real humans using objective metrics and subjective user ratings. Experimental results demonstrate that the proposed challenge and virtual environment enable a systematic evaluation on the important aspects of machine social intelligence at scale.

研究动机与目标

  • 激发并定义一个新的 AI 挑战,用于测试社会认知(从观察中推断目标)和协同规划(在未知环境中高效协助)。
  • 将 VirtualHome 扩展为多智能体场景,使 AI 代理、内置的人类代理和真实人类能够在复杂家庭任务中进行互动。
  • 提供一个包含目标推断模型与规划/深度强化学习基线的基准,用于大规模研究机器社会智能。

提出的方法

  • 提出一个两阶段的 Watch-And-Help 框架:Watch 阶段,Bob 观察 Alice 执行任务以推断她的目标;Help 阶段,Bob 与 Alice 合作在不同环境中高效地实现相同的目标。
  • 构建 VirtualHome-Social,一个具有符号和视觉观测、对象交互以及内置的人类样代理的多智能体家居环境,能够在对 Bob 的响应中重新规划。
  • 通过描述为包含计数的谓词集合的目标来定义任务,表示五组家庭活动谓词(例如布置餐桌、冰箱食品、烹饪、洗碗、边吃零食边阅读)。
  • 实现一个目标推断模型,使用可见对象上的 Transformer+LSTM 来预测谓词计数;采用层次化规划/学习架构,在高层子目标被选择后,低层策略/规划者执行动作。
  • 评估基线,包括 HP(带 MCTS RP 的分层规划器)、Hybrid(RL+RP)、HRL(分层强化学习)、和 Random,以及具有完整目标知识的 Oracle 变体。

实验结果

研究问题

  • RQ1在一个现实的多智能体环境中,AI 能否从单次演示中推断出人类的目标?
  • RQ2AI 代理在未知环境中与类似人类的代理协同、规划以最小化任务完成时间的能力如何?
  • RQ3在家庭任务中促成高效人机协作的关键因素有哪些?
  • RQ4目标推断的准确性如何影响不同任务类别中的协作性能?

主要发现

  • 在 test-1 上的目标推断精度/召回率达到 0.85/0.96;使用完整演示可以获得更高的精度/召回率(0.99/0.99)。
  • 在 Help 阶段,带有真实目标的 HP 基线在非 Oracle 基线中取得最佳性能,成功率和加速程度高于其他基线。
  • 使用推断目标(RG)可能因与 Alice 的计划冲突而降低性能,凸显了动态目标调整的必要性。
  • Test-2(多活动任务)降低目标预测准确性(0.68/0.64)并削弱帮助性能,显示出对多活动场景的泛化挑战。
  • Alice 单独在 Help 阶段达到 95.4% 的成功率,而 HP 基线达到 88.6% 的成功率和 0.21 的加速;test-2 的性能下降是由于较差的目标识别。
  • 人类实验表明,当与真实人类搭配时,AI 基线保持相对排名,且用户评分与客观指标一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。