[论文解读] Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration
WAH 引入一个两阶段挑战:AI 观察一个类似人类的代理以推断目标,然后在一个新环境中与之合作尽快完成家庭任务。它在 VirtualHome-Social 中评估社会认知和人机协作。
In this paper, we introduce Watch-And-Help (WAH), a challenge for testing social intelligence in agents. In WAH, an AI agent needs to help a human-like agent perform a complex household task efficiently. To succeed, the AI agent needs to i) understand the underlying goal of the task by watching a single demonstration of the human-like agent performing the same task (social perception), and ii) coordinate with the human-like agent to solve the task in an unseen environment as fast as possible (human-AI collaboration). For this challenge, we build VirtualHome-Social, a multi-agent household environment, and provide a benchmark including both planning and learning based baselines. We evaluate the performance of AI agents with the human-like agent as well as with real humans using objective metrics and subjective user ratings. Experimental results demonstrate that the proposed challenge and virtual environment enable a systematic evaluation on the important aspects of machine social intelligence at scale.
研究动机与目标
- 激发并定义一个新的 AI 挑战,用于测试社会认知(从观察中推断目标)和协同规划(在未知环境中高效协助)。
- 将 VirtualHome 扩展为多智能体场景,使 AI 代理、内置的人类代理和真实人类能够在复杂家庭任务中进行互动。
- 提供一个包含目标推断模型与规划/深度强化学习基线的基准,用于大规模研究机器社会智能。
提出的方法
- 提出一个两阶段的 Watch-And-Help 框架:Watch 阶段,Bob 观察 Alice 执行任务以推断她的目标;Help 阶段,Bob 与 Alice 合作在不同环境中高效地实现相同的目标。
- 构建 VirtualHome-Social,一个具有符号和视觉观测、对象交互以及内置的人类样代理的多智能体家居环境,能够在对 Bob 的响应中重新规划。
- 通过描述为包含计数的谓词集合的目标来定义任务,表示五组家庭活动谓词(例如布置餐桌、冰箱食品、烹饪、洗碗、边吃零食边阅读)。
- 实现一个目标推断模型,使用可见对象上的 Transformer+LSTM 来预测谓词计数;采用层次化规划/学习架构,在高层子目标被选择后,低层策略/规划者执行动作。
- 评估基线,包括 HP(带 MCTS RP 的分层规划器)、Hybrid(RL+RP)、HRL(分层强化学习)、和 Random,以及具有完整目标知识的 Oracle 变体。
实验结果
研究问题
- RQ1在一个现实的多智能体环境中,AI 能否从单次演示中推断出人类的目标?
- RQ2AI 代理在未知环境中与类似人类的代理协同、规划以最小化任务完成时间的能力如何?
- RQ3在家庭任务中促成高效人机协作的关键因素有哪些?
- RQ4目标推断的准确性如何影响不同任务类别中的协作性能?
主要发现
- 在 test-1 上的目标推断精度/召回率达到 0.85/0.96;使用完整演示可以获得更高的精度/召回率(0.99/0.99)。
- 在 Help 阶段,带有真实目标的 HP 基线在非 Oracle 基线中取得最佳性能,成功率和加速程度高于其他基线。
- 使用推断目标(RG)可能因与 Alice 的计划冲突而降低性能,凸显了动态目标调整的必要性。
- Test-2(多活动任务)降低目标预测准确性(0.68/0.64)并削弱帮助性能,显示出对多活动场景的泛化挑战。
- Alice 单独在 Help 阶段达到 95.4% 的成功率,而 HP 基线达到 88.6% 的成功率和 0.21 的加速;test-2 的性能下降是由于较差的目标识别。
- 人类实验表明,当与真实人类搭配时,AI 基线保持相对排名,且用户评分与客观指标一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。