Skip to main content
QUICK REVIEW

[论文解读] Adaptive Coordination in Social Embodied Rearrangement

Andrew Szot, Unnat Jain|arXiv (Cornell University)|May 31, 2023
Social Robot Interaction and HRI被引用 5
一句话总结

本文提出社交重排(Social Rearrangement),一种在逼真3D环境中进行的多智能体任务,要求两名机器人仅通过自身视角观察协作完成长时程、日常化的任务。为实现与未见过的伙伴进行零样本协调,作者提出行为多样性博弈(Behavior Diversity Play, BDP),该方法采用共享策略架构与可区分性目标,强制在群体中实现行为多样性,使成功率提高35%,效率提高32%,优于基线方法。

ABSTRACT

We present the task of "Social Rearrangement", consisting of cooperative everyday tasks like setting up the dinner table, tidying a house or unpacking groceries in a simulated multi-agent environment. In Social Rearrangement, two robots coordinate to complete a long-horizon task, using onboard sensing and egocentric observations, and no privileged information about the environment. We study zero-shot coordination (ZSC) in this task, where an agent collaborates with a new partner, emulating a scenario where a robot collaborates with a new human partner. Prior ZSC approaches struggle to generalize in our complex and visually rich setting, and on further analysis, we find that they fail to generate diverse coordination behaviors at training time. To counter this, we propose Behavior Diversity Play (BDP), a novel ZSC approach that encourages diversity through a discriminability objective. Our results demonstrate that BDP learns adaptive agents that can tackle visual coordination, and zero-shot generalize to new partners in unseen environments, achieving 35% higher success and 32% higher efficiency compared to baselines.

研究动机与目标

  • 解决在视觉丰富、长时程多智能体任务中实现零样本协调的挑战,即智能体必须在无特权信息的情况下适应未见过的伙伴。
  • 克服先前零样本协调方法在复杂环境中因训练群体行为多样性不足而导致的失败问题。
  • 开发一种可扩展、样本高效的框架,通过共享视觉编码器与行为潜在空间训练适应性智能体。
  • 在真实、高保真的仿真环境中评估该方法,该环境模拟现实世界中的人机协作场景。
  • 证明通过可区分性目标强制实现行为多样性,可实现对未见过的伙伴和环境的鲁棒泛化。

提出的方法

  • 提出行为多样性博弈(BDP),一种零样本协调框架,通过共享策略架构与可区分性目标,训练具有多样化行为的智能体群体。
  • 使用判别器网络区分群体中的不同行为,鼓励产生差异化动作,例如在摆桌任务中分别去拿不同物品。
  • 使用行为潜在空间对群体进行参数化,而非随机策略初始化,从而实现高效探索与训练。
  • 训练协调智能体以适应通过第一视角视觉观察到的多样化伙伴行为,且不访问特权状态或动作信息。
  • 在所有智能体之间共享视觉编码器,以提升样本效率,并实现在复杂、高维视觉输入下的泛化能力。
  • 在使用AI Habitat和ReplicaCAD数据集的仿真环境中应用该方法,由两只Fetch机器人执行摆桌、整理房屋、拆卸杂货等任务。

实验结果

研究问题

  • RQ1当训练群体缺乏行为多样性时,零样本协调方法能否在视觉丰富、长时程任务中泛化到未见过的伙伴?
  • RQ2通过可区分性目标强制实现行为多样性,是否能提升复杂、部分可观测环境中的零样本协调性能?
  • RQ3与随机初始化相比,采用共享策略架构与行为潜在空间在多智能体协调中的样本效率与泛化能力如何?
  • RQ4BDP在多种任务类型与未见过的伙伴行为下,相较于现有零样本协调基线,在成功率与效率方面提升程度如何?
  • RQ5协调智能体能否在类似真实世界的场景中适应具有不同任务特定偏好的脚本化与学习型未见过伙伴?

主要发现

  • 在Social Rearrangement任务的零样本协调中,BDP相比最先进基线,成功率提高35%,效率提高32%。
  • 消融实验表明,即使训练群体性能保持高位,若移除判别器目标,零样本泛化性能仍显著下降,证明可区分性目标的必要性。
  • 采用共享视觉编码器与行为潜在空间的BDP优于使用随机策略初始化或独立网络的变体,证明权重共享与结构化多样性的关键作用。
  • 在Tidy House与Prepare Groceries任务中,BDP分别实现66.71%与75.85%的零样本成功率,显著优于PBT(30.34%与34.56%)及其他基线。
  • 该方法对未见过的伙伴泛化良好,包括脚本化智能体(如始终清洁厨房)与具有多样化偏好的学习型智能体,在Tidy House任务中对未见过的脚本化与学习型伙伴的成功率分别为46.90%与74.14%。
  • BDP训练群体表现出多样化行为——例如部分智能体专注于碗,另一些则关注水果——而基于PBT的群体则强烈偏向单一物体,限制了适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。