Skip to main content
QUICK REVIEW

[论文解读] Learning to Draw: Emergent Communication through Sketching

Daniela Mihai, Jonathon Hare|ePrints Soton (University of Southampton)|Jun 3, 2021
Multimodal Machine Learning Applications参考文献 37被引用 5
一句话总结

本文提出了一种基于可微草图的通信框架,其中神经网络智能体通过在参照游戏中以绘画方式传达视觉概念来学习通信。通过引入感知损失,智能体生成的人类可理解的草图在保持高任务性能的同时,展示了视觉通信可作为多智能体系统中符号语言的自解释性替代方案。

ABSTRACT

Evidence that visual communication preceded written language and provided a basis for it goes back to prehistory, in forms such as cave and rock paintings depicting traces of our distant ancestors. Emergent communication research has sought to explore how agents can learn to communicate in order to collaboratively solve tasks. Existing research has focused on language, with a learned communication channel transmitting sequences of discrete tokens between the agents. In this work, we explore a visual communication channel between agents that are allowed to draw with simple strokes. Our agents are parameterised by deep neural networks, and the drawing procedure is differentiable, allowing for end-to-end training. In the framework of a referential communication game, we demonstrate that agents can not only successfully learn to communicate by drawing, but with appropriate inductive biases, can do so in a fashion that humans can interpret. We hope to encourage future research to consider visual communication as a more flexible and directly interpretable alternative of training collaborative agents.

研究动机与目标

  • 探索视觉通信作为新兴多智能体通信中符号语言的更可解释性替代方案。
  • 研究可微草图是否能使智能体学习到既有效又对人类可解释的通信协议。
  • 考察归纳偏差和损失函数如何影响新兴视觉通信的形式与可解释性。
  • 评估人类参与者是否能在参照游戏设置中成功解码由训练后的智能体生成的草图。
  • 为研究人工智能智能体之间视觉通信的演化——从原始草图到象形符号乃至文字——奠定基础。

提出的方法

  • 智能体由深度神经网络参数化,并使用可微的绘图过程,以连续曲线生成笔画。
  • 该框架采用一种参照性通信游戏,其中一名智能体绘制目标图像的草图,另一名智能体从一组候选图像中猜测正确图像。
  • 训练采用结合了游戏损失(以最大化猜测准确率)和感知损失(以提高与真实图像的视觉相似性)的损失函数。
  • 通过在视觉编码器中引入归纳偏差(如形状偏好),引导智能体生成更具符号性、可解释性的草图。
  • 感知损失通过预训练的卷积神经网络(如VGG)的特征计算,以鼓励生成草图在结构和语义上与真实图像相似。
  • 实验比较了不同设置下的性能表现:标准游戏损失、感知损失、基于对象的游戏,以及不同数量的干扰项。

实验结果

研究问题

  • RQ1智能体是否能在没有显式人类监督的情况下,通过草图在参照游戏中实现有效通信?
  • RQ2在训练目标中加入感知损失是否能提升新兴草图的人类可解释性,同时不降低任务性能?
  • RQ3游戏目标的变化(如基于对象 vs. 基于图像的游戏)如何影响新兴视觉通信的形式?
  • RQ4视觉系统中的归纳偏差在多大程度上影响草图的符号性或象形特征?
  • RQ5在真实人机交互场景中,人类是否能成功解码由感知损失训练的智能体生成的草图?

主要发现

  • 仅使用游戏损失训练的智能体生成的草图对人类不可解释,人类猜测任务的准确率仅为8.3%(随机猜测为10%)。
  • 加入感知损失后,人类猜测准确率提升至38.3%,类别识别准确率提升至55.6%,显著高于随机猜测水平。
  • 当干扰项数量增加至50个时,感知损失训练智能体的性能仍保持强劲:草图识别准确率为37.2%,类别识别准确率为47.8%。
  • 基于对象的游戏促使智能体生成更具符号性和抽象性的草图,表明任务设计会影响新兴视觉通信的形式。
  • 视觉系统中的形状偏好提升了草图的可解释性,表明内部归纳偏差会影响通信风格。
  • 人类能够成功解码由感知损失训练的智能体生成的草图,证明该通信协议具有直接可解释性,并可在人机交互中实际使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。