Skip to main content
QUICK REVIEW

[论文解读] Emergent Graphical Conventions in a Visual Communication Game

Shuwen Qiu, Sirui Xie|arXiv (Cornell University)|Nov 28, 2021
Aesthetic Perception and Analysis参考文献 45被引用 5
一句话总结

本文提出了一种强化学习框架,用于建模双智能体视觉通信游戏中图形惯例的涌现,其中智能体协作演化出抽象素描以传达视觉概念。主要贡献在于证明了在适当的训练条件下,智能体能够共同演化为具有符号性、图像性和语义结构的素描,同时保持感知相似性和类别间关系。

ABSTRACT

Humans communicate with graphical sketches apart from symbolic languages. Primarily focusing on the latter, recent studies of emergent communication overlook the sketches; they do not account for the evolution process through which symbolic sign systems emerge in the trade-off between iconicity and symbolicity. In this work, we take the very first step to model and simulate this process via two neural agents playing a visual communication game; the sender communicates with the receiver by sketching on a canvas. We devise a novel reinforcement learning method such that agents are evolved jointly towards successful communication and abstract graphical conventions. To inspect the emerged conventions, we define three fundamental properties -- iconicity, symbolicity, and semanticity -- and design evaluation methods accordingly. Our experimental results under different controls are consistent with the observation in studies of human graphical conventions. Of note, we find that evolved sketches can preserve the continuum of semantics under proper environmental pressures. More interestingly, co-evolved agents can switch between conventionalized and iconic communication based on their familiarity with referents. We hope the present research can pave the path for studying emergent communication with the modality of sketches.

研究动机与目标

  • 建模并模拟视觉通信中图形惯例的演化,重点关注从图像性到符号性表征的转变。
  • 研究智能体在缺乏预定义符号词汇表的情况下,如何在图像性和符号性之间取得平衡。
  • 使用三个核心属性——图像性、符号性和语义性——评估图形惯例的涌现。
  • 探索演化素描是否能保持概念之间的感知和语义关系,以模拟人类认知过程。
  • 为未来在符号语言之外的视觉模态中研究涌现通信奠定基础。

提出的方法

  • 将双智能体视觉通信游戏建模为交替的顺序决策过程,其中发送方在画布上生成一系列笔画,接收方对素描进行评估。
  • 提出一种新颖的强化学习方法,使用联合价值函数和优势迹(eligibility trace)以实现通信通道的有效反向传播,区别于REINFORCE或独立价值函数方法。
  • 笔画以连续参数化方式表示(非离散标记),从而在训练过程中实现更平滑的梯度流动和更优的函数逼近。
  • 该框架结合蒙特卡洛采样与函数逼近,以增强智能体对复杂抽象素描之间相关性的认知。
  • 使用预训练VGG网络的深度特征和word2vec嵌入向量定义三种评估指标:图像性、符号性和语义性。
  • 采用t-SNE可视化和距离相关性分析,评估素描嵌入空间相对于图像空间和语义空间的拓扑结构。

实验结果

研究问题

  • RQ1在不依赖符号标记的情况下,智能体如何在视觉通信游戏中演化出图形惯例?
  • RQ2演化素描在发展符号性(任意惯例性)的同时,能在多大程度上保持图像性(视觉相似性)?
  • RQ3演化素描的嵌入空间中,概念之间的语义关系是否能够得以保持?
  • RQ4环境因素(如早期决策和相互适应)如何影响惯例的涌现?
  • RQ5智能体能否根据对指称物的熟悉程度,动态切换图标式与惯例化通信方式?

主要发现

  • 所提出的强化学习框架成功实现了发送方与接收方智能体在连续笔画基础上的联合演化,实现了有效的视觉通信。
  • 演化素描表现出明显的图像性与符号性之间的权衡:智能体逐渐抽象掉非必要特征,同时保留显著部分(如公鸡的鸡冠、长颈鹿的脖子)。
  • 语义性得以保持:t-SNE可视化显示语义上相似的类别(如牛、鹿、马)在嵌入空间中仍保持接近,且素描与word2vec特征之间的距离相关性显著。
  • 完整训练设置在保持语义结构方面优于检索基线,表现为素描与语义嵌入之间实例间距离的相关性更高。
  • 素描演化呈现非单调模式:初始阶段复杂度上升,随后简化,表明在抽象化之前存在一个探索阶段。
  • 智能体表现出上下文依赖的通信行为:可根据对指称物的熟悉程度在图标式与惯例化风格之间动态切换,表明其对视觉惯例具有自适应使用能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。