[论文解读] Avoiding hashing and encouraging visual semantics in referential emergent language games
本文研究了如何在多智能体指代游戏中促进涌现通信,以捕捉视觉语义而非依赖图像哈希。通过在游戏设置中引入输入增强(噪声、旋转)并增加自监督的旋转预测任务,作者表明端到端训练的模型无需预训练即可学习到语义上稳固的语言,实现了84%的旋转预测准确率,并在语义对齐方面优于哈希类解决方案。
There has been an increasing interest in the area of emergent communication between agents which learn to play referential signalling games with realistic images. In this work, we consider the signalling game setting of Havrylov and Titov and investigate the effect of the feature extractor's weights and of the task being solved on the visual semantics learned or captured by the models. We impose various augmentation to the input images and additional tasks in the game with the aim to induce visual representations which capture conceptual properties of images. Through our set of experiments, we demonstrate that communication systems which capture visual semantics can be learned in a completely self-supervised manner by playing the right types of game.
研究动机与目标
- 探究指代游戏中涌现语言是否能捕捉视觉语义而非依赖图像哈希。
- 考察不同视觉特征提取器权重(预训练、随机初始化、端到端学习)对语义对齐的影响。
- 评估在游戏任务中增加额外任务(如旋转预测)是否能促进更语义化的通信。
- 确定完全自监督训练(无任何人工标注的视觉语义)是否能产生语义上稳固的语言。
- 探索输入级增强(噪声、旋转)是否能提升通信系统中视觉语义的涌现。
提出的方法
- 使用Havrylov和Titov的指代游戏的改进版本,采用CIFAR-10图像和最多5个词元的消息长度。
- 采用端到端训练模型,使用Straight-Through Gumbel-Softmax生成离散词元,并使用铰链损失最大化正确图像选择。
- 仅对发送方的输入图像应用数据增强(颜色抖动、随机翻转、灰度化、噪声和90°旋转)。
- 引入一个辅助任务:一个智能体必须预测发送方输入图像的旋转角度,以促进对物体级结构的理解。
- 训练不同CNN权重配置的模型:ImageNet预训练并固定的、随机初始化并冻结的,以及端到端学习的。
- 在发送方和接收方的CNN和LSTM之后均使用BatchNorm层,以提升训练稳定性和可复现性。
实验结果
研究问题
- RQ1预训练视觉特征提取器在多大程度上提升了指代游戏中涌现语言所捕捉的视觉语义?
- RQ2如噪声和旋转等输入级增强是否能促使智能体学习到更语义化的表示,而非图像哈希?
- RQ3在多任务学习设置中,增加自监督旋转预测任务是否会导致更语义化的通信?
- RQ4完全自监督的端到端训练过程是否能产生反映概念性视觉属性的涌现语言,而无需任何监督?
- RQ5不同CNN权重初始化策略(预训练、随机初始化、端到端学习)如何影响通信成功率与语义对齐之间的平衡?
主要发现
- 使用固定预训练VGG-16特征提取器的模型在噪声增强下取得了最高的通信成功率(92%)和top-5准确率(99%),表明其具有强大的语义对齐能力。
- 在旋转增强下,端到端学习的模型取得了92%的通信成功率和100%的top-5准确率,表明无需预训练也能实现语义对齐。
- 引入旋转预测任务后,发送方预测设置下的旋转准确率达到84%,表明模型学会了识别物体级结构。
- 随机初始化并冻结的CNN在噪声增强下取得了96%的通信成功率,表明当任务具有挑战性时,无需预训练也能实现高性能。
- 在旋转增强下,预训练模型的通信成功率略有下降(83%),表明预训练可能与几何变换的鲁棒性存在冲突。
- 结合旋转预测任务的端到端模型,其目标类别平均排名为43.41,表明其与人类对视觉语义的理解对齐程度优于基于哈希的解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。