[论文解读] CoDraw: Collaborative Drawing as a Testbed for Grounded Goal-driven Communication
CoDraw 引入了一项协作绘画任务,其中 Teller 通过自然语言描述目标场景,Drawer 则在虚拟环境中使用可移动的剪贴画重建该场景,从而实现基于语境的、以目标为导向的交流。其主要贡献是一种交叉对话训练与评估协议,可防止智能体发展出非自然的共享代码本,从而实现与人类判断高度相关的自动化评估。
In this work, we propose a goal-driven collaborative task that combines language, perception, and action. Specifically, we develop a Collaborative image-Drawing game between two agents, called CoDraw. Our game is grounded in a virtual world that contains movable clip art objects. The game involves two players: a Teller and a Drawer. The Teller sees an abstract scene containing multiple clip art pieces in a semantically meaningful configuration, while the Drawer tries to reconstruct the scene on an empty canvas using available clip art pieces. The two players communicate with each other using natural language. We collect the CoDraw dataset of ~10K dialogs consisting of ~138K messages exchanged between human players. We define protocols and metrics to evaluate learned agents in this testbed, highlighting the need for a novel "crosstalk" evaluation condition which pairs agents trained independently on disjoint subsets of the training data. We present models for our task and benchmark them using both fully automated evaluation and by having them play the game live with humans.
研究动机与目标
- 开发一个整合语言、感知与行动的基于语境的、以目标为导向的交流测试平台。
- 研究智能体如何通过自然语言协作实现视觉重建目标。
- 解决在训练过程中防止智能体学习非自然、共享代码本的挑战。
- 设计一种交叉对话评估协议,以确保泛化能力并促进自然语言使用。
- 通过自动化指标与人类评估相结合的方式对模型进行基准测试,验证自动化评估的可靠性。
提出的方法
- CoDraw 任务包含两名智能体:Teller 可见目标场景,Drawer 则在空白画布上使用剪贴画对象重建该场景。
- 交流通过自然语言进行,Teller 描述目标场景,Drawer 解释并执行操作以放置、定向和调整剪贴画的大小。
- 从人类-人类互动中收集了约 10,000 组对话,共约 138,000 条消息,每一步均包含场景和对话历史。
- 引入了一种剪贴画场景的相似性度量,用于在最终阶段和中间阶段自动化评估重建质量。
- 提出了交叉对话训练协议,即 Teller 和 Drawer 在互不重叠的数据子集上进行训练,以防止串通并鼓励使用自然语言。
- 通过自动化指标和人工实时配对对模型进行评估,结果显示自动化评估与人类评估之间存在强相关性。
实验结果
研究问题
- RQ1智能体能否在涉及感知、语言与行动的基于语境的协作任务中有效学习交流?
- RQ2如何防止智能体在训练过程中发展出非自然的、相互约定的代码本?
- RQ3在交叉对话协议下,自动化评估是否能可靠地反映人类在协作交流任务中的表现?
- RQ4在长时序、上下文敏感的交流任务(如 CoDraw)中,主要的失败模式是什么?
- RQ5模仿学习与强化学习在基于语境对话中的推理与规划能力提升方面,其作用程度如何?
主要发现
- 交叉对话训练与评估协议成功防止了智能体发展出非自然的代码本,确保了交流始终基于自然语言。
- 在交叉对话协议下,自动化评估与人类评估表现出强相关性,验证了其作为人类判断可靠代理的有效性。
- 通过强化学习微调的 scene2seq Teller 模型在相似性度量上表现优于模仿学习基线模型与基于规则的最近邻模型(得分分别为 3.65、2.69 和 3.21)。
- 人类 Teller 的相似性得分为 4.17,而最佳模型组合(scene2seq Teller + 最佳 Drawer)达到 3.65,表明在上下文推理与长期规划方面仍存在差距。
- Teller 的常见错误包括引用不存在的物体(基线模型在 5 个测试场景中引用了 11 次不存在的物体)以及描述冗余或遗漏,这些错误通过辅助损失和强化学习微调得到缓解。
- Drawer 模型常出现语义不一致的放置行为,例如将帽子放置在空中,表明其在空间与关系推理方面仍面临挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。