[论文解读] Emergent Discrete Communication in Semantic Spaces
本文提出了一种新型神经架构,用于多智能体强化学习中的涌现离散通信,其中智能体使用嵌入在连续语义空间中的离散标记,而非一位全向量。通过学习有意义地聚类这些标记,智能体在噪声环境中实现了稳健的零样本泛化,并支持对未标记通信的人类理解,其在人类理解与团队性能方面均优于一位全向基线方法。
Neural agents trained in reinforcement learning settings can learn to communicate among themselves via discrete tokens, accomplishing as a team what agents would be unable to do alone. However, the current standard of using one-hot vectors as discrete communication tokens prevents agents from acquiring more desirable aspects of communication such as zero-shot understanding. Inspired by word embedding techniques from natural language processing, we propose neural agent architectures that enables them to communicate via discrete tokens derived from a learned, continuous space. We show in a decision theoretic framework that our technique optimizes communication over a wide range of scenarios, whereas one-hot tokens are only optimal under restrictive assumptions. In self-play experiments, we validate that our trained agents learn to cluster tokens in semantically-meaningful ways, allowing them communicate in noisy environments where other techniques fail. Lastly, we demonstrate both that agents using our method can effectively respond to novel human communication and that humans can understand unlabeled emergent agent communication, outperforming the use of one-hot communication.
研究动机与目标
- 为解决一位全向量在涌现通信中的局限性,其缺乏语义关系,阻碍零样本理解。
- 使神经智能体能够在连续且语义有意义的空间中学习离散通信标记,受自然语言处理中词嵌入的启发。
- 证明该方法可在环境噪声下支持稳健通信,并实现对未标记智能体通信的人类理解。
- 验证智能体能否利用学习到的语义空间响应人类提供的新短语。
- 表明学习到的标记聚类与人类可理解的语义分组一致,例如将动物与车辆区分开。
提出的方法
- 智能体使用基于原型的架构,其中离散通信标记被表示为连续向量空间中的可学习嵌入,而非一位全向量。
- 通信机制通过决策理论框架中的自我对弈进行训练,以优化任务成功率与语义聚类。
- 通过可微分路由机制更新标记分配,以在嵌入空间中聚类相似概念(例如动物、车辆)。
- 模型使用对比损失,以鼓励同一类别标记之间的语义相似性及跨类别标记之间的差异性。
- 通过亚马逊机械 Turk 进行人类评估,以衡量对未标记智能体通信的零样本理解能力。
- 在参考游戏与人类理解任务中,将该方法与 BERT 嵌入和一位全向基线进行比较。
实验结果
研究问题
- RQ1智能体能否在连续语义空间中学习使用嵌入的离散标记进行通信,从而实现比一位全向量更具可解释性与鲁棒性的通信?
- RQ2在连续语义空间中学习是否能实现对新输入(如未见过的英文短语)更好的零样本泛化?
- RQ3当标记以语义上有意义的方式聚类时,人类能否理解未标记的涌现通信标记?
- RQ4该方法在人类理解与团队性能方面与一位全向与 BERT 基线相比表现如何?
- RQ5标记的语义聚类是否能提升通信在环境噪声下的鲁棒性?
主要发现
- 五组训练模型中有四组在人类对未标记智能体通信的理解任务中显著优于 BERT 嵌入,准确率在 76.08% 至 79.00% 之间,而 BERT 的准确率为 65.83%。
- 未能收敛的模型(Proto-1)表现出随机猜测水平的性能(49.32%),但其余四组模型均展现出稳健且高性能的通信聚类。
- 成功训练后,智能体学习到将标记聚类为语义上有意义的组别,例如将动物与车辆区分开,从而提升了零样本性能。
- 该方法实现了对人类提供新英文短语的有效响应,展示了实际互操作性。
- 人类参与者能够以高准确率理解智能体的涌现通信,表明所学通信具有语义可解释性。
- 连续语义空间方法在抗噪声能力与人类理解方面均优于一位全向向量,验证了其在现实通信场景中的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。