Skip to main content
QUICK REVIEW

[论文解读] Interpretable agent communication from scratch (with a generic visual processor emerging on the side)

Roberto Dessì, Eugene Kharitonov|arXiv (Cornell University)|Jun 8, 2021
Domain Adaptation and Few-Shot Learning参考文献 46被引用 9
一句话总结

本文提出从零开始训练两个深度神经网络,以在自然图像的指代性通信中发展出一种离散且可解释的通信协议,采用受对比学习启发的设置。智能体通过涌现符号来指代对象——包括未见过的类别——同时学习到高质量的通用视觉特征,其性能可与最先进的自监督模型(如SimCLR)相媲美。

ABSTRACT

As deep networks begin to be deployed as autonomous agents, the issue of how they can communicate with each other becomes important. Here, we train two deep nets from scratch to perform realistic referent identification through unsupervised emergent communication. We show that the largely interpretable emergent protocol allows the nets to successfully communicate even about object types they did not see at training time. The visual representations induced as a by-product of our training regime, moreover, show comparable quality, when re-used as generic visual features, to a recent self-supervised learning model. Our results provide concrete evidence of the viability of (interpretable) emergent deep net communication in a more realistic scenario than previously considered, as well as establishing an intriguing link between this field and self-supervised visual learning.

研究动机与目标

  • 开发一种完全端到端、可解释的涌现通信协议,使深度智能体之间无需预训练视觉特征即可实现通信。
  • 探究指代性游戏中涌现通信是否能产生高质量的通用视觉表征。
  • 评估该协议在未见物体类别上的泛化能力及其对人类的可解释性。
  • 通过共享训练目标,弥合涌现通信与自监督视觉表征学习之间的鸿沟。
  • 证明在真实、大规模图像环境中,离散且可解释的通信可从零开始自然涌现。

提出的方法

  • 智能体使用大规模数据集中的自然图像进行指代性通信游戏,不依赖预训练视觉编码器。
  • 采用对比学习目标,促使发送方为不同目标对象生成不同的符号,同时接收方需从一组干扰项中正确识别目标。
  • 应用输入数据增强以提升鲁棒性与泛化能力,灵感源自自监督学习。
  • 提取智能体学习到的视觉表征,并在下游分类基准上评估其作为通用特征的性能。
  • 通过分析符号与对象的对应关系及其在各类别间的一致性,评估通信协议的可解释性。
  • 方法基于EGG框架实现,训练从随机初始化端到端进行。

实验结果

研究问题

  • RQ1深度智能体能否仅依靠指代性游戏的性能作为训练信号,从零开始学习一种离散且可解释的通信协议?
  • RQ2在通信训练过程中学习到的视觉表征是否能良好泛化到下游视觉任务?
  • RQ3涌现的通信协议能否泛化到训练期间未见过的物体类别?
  • RQ4与最先进的自监督方法相比,涌现视觉特征的质量如何?
  • RQ5该涌现通信协议的可解释性程度如何?能否被视为一种无监督图像标注形式?

主要发现

  • 智能体成功学习到一种离散且部分可解释的通信协议,即使在训练中未见过的物体类别上也能实现准确的指代性通信。
  • 所涌现的视觉表征在分类性能上可与专为视觉特征学习设计的自监督方法SimCLR相媲美。
  • 该协议可实现零样本泛化,表明符号代表的是语义类别,而不仅仅是低级图像特征。
  • 输入数据增强的使用显著提升了通信和视觉表征学习的鲁棒性与质量。
  • 作为通信训练副产物产生的视觉表征质量很高,可在多个视觉任务中有效重用。
  • 结果表明,涌现通信与自监督视觉表征学习之间存在强烈关联,提示未来两者可实现互利整合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。