Skip to main content
QUICK REVIEW

[论文解读] Using Indirect Encoding of Multiple Brains to Produce Multimodal Behavior

Jacob Schrum, Joel Lehman|arXiv (Cornell University)|Apr 26, 2016
Reinforcement Learning in Robotics参考文献 16被引用 4
一句话总结

本文提出多脑HyperNEAT(MB-HyperNEAT),一种新颖的间接编码框架,可在不假设控制器之间几何关系的前提下,为多模态行为演化多个独立的神经网络(‘大脑’)。通过结合HyperNEAT的可扩展间接编码与MM-NEAT的模块化、基于偏好神经元的控制机制,MB-HyperNEAT使演化过程能够自动发现不同策略的数量及其激活逻辑,在多模态领域中的表现优于先前方法(如情境策略几何)。

ABSTRACT

An important challenge in neuroevolution is to evolve complex neural networks with multiple modes of behavior. Indirect encodings can potentially answer this challenge. Yet in practice, indirect encodings do not yield effective multimodal controllers. Thus, this paper introduces novel multimodal extensions to HyperNEAT, a popular indirect encoding. A previous multimodal HyperNEAT approach called situational policy geometry assumes that multiple brains benefit from being embedded within an explicit geometric space. However, experiments here illustrate that this assumption unnecessarily constrains evolution, resulting in lower performance. Specifically, this paper introduces HyperNEAT extensions for evolving many brains without assuming geometric relationships between them. The resulting Multi-Brain HyperNEAT can exploit human-specified task divisions to decide when each brain controls the agent, or can automatically discover when brains should be used, by means of preference neurons. A further extension called module mutation allows evolution to discover the number of brains, enabling multimodal behavior with even less expert knowledge. Experiments in several multimodal domains highlight that multi-brain approaches are more effective than HyperNEAT without multimodal extensions, and show that brains without a geometric relation to each other outperform situational policy geometry. The conclusion is that Multi-Brain HyperNEAT provides several promising techniques for evolving complex multimodal behavior.

研究动机与目标

  • 解决现有多模态神经演化方法依赖控制器之间几何假设的局限性,此类假设限制了其在非几何行为模式中的适用性。
  • 减少对人工指定任务划分的依赖,使演化过程能够自主发现何时以及如何使用多个独立的神经控制器。
  • 引入一种新机制——模块突变(module mutation),使演化过程能动态确定最优大脑数量,从而最小化人工干预。
  • 通过可扩展、模块化的神经网络演化,评估间接编码在支持复杂多模态行为方面的有效性。

提出的方法

  • 在HyperNEAT中扩展多个独立基底结构,每个结构承载一个独立的神经网络(‘大脑’),通过CPPN进行演化,实现在无几何约束下对大规模复杂网络的间接编码。
  • 引入偏好神经元,使智能体能根据环境上下文自主选择控制行为的大脑,从而消除对人工指定任务划分的依赖。
  • 实现模块突变,一种遗传算子,使演化过程可在搜索过程中生成新大脑,实现控制器数量的动态发现。
  • 使用多任务CPPN同时编码多个大脑,使控制器之间共享结构规律性,同时保持模块化与独立性。
  • 在四个多模态领域(包括两个新领域)应用该框架,评估在不同任务划分与模块化程度下的性能表现。
  • 通过适应度分数、大脑使用模式及统计显著性,将MB-HyperNEAT与基线方法(HyperNEAT、情境策略几何、MM-NEAT变体)进行对比。

实验结果

研究问题

  • RQ1是否可以使用一种不假设不同控制器之间几何关系的间接编码框架,有效演化出多模态行为?
  • RQ2在缺乏人工指定任务划分的情况下,偏好神经元在多大程度上能实现自主大脑选择?
  • RQ3模块突变是否能帮助演化过程发现最优大脑数量,从而在性能上超越固定架构方法?
  • RQ4在具有不同任务结构程度的多模态领域中,MB-HyperNEAT与情境策略几何及标准HyperNEAT的性能相比如何?

主要发现

  • 使用多任务CPPN的多脑HyperNEAT在所有测试领域中均持续优于情境策略几何,表明控制器之间的几何约束并非必要,甚至可能产生负面影响。
  • 基于偏好神经元的方法在大多数领域中达到与情境策略几何相当的适应度分数,尽管缺乏人工指定的任务划分,显示出极强的适应能力。
  • 采用偏好神经元的智能体显著优于标准HyperNEAT(未扩展多模态功能),表明通过多个大脑实现多模态控制可显著提升性能,即使在无预先任务分解的情况下亦然。
  • 尽管产生了大量未使用的脑,模块突变方法的性能仍与固定架构的偏好神经元方法相当,表明类似“内含子”的CPPN区域可能通过支持罕见有益突变,为演化提供鲁棒性。
  • 所有领域中的最终优胜者仅使用了一到三个大脑,表明超过三个大脑通常并非必需,且当选择机制有效时,大脑数量并非性能的强决定因素。
  • 结果表明,MB-HyperNEAT可显著减少设计多模态控制器时对专家知识的依赖,使其成为一种可扩展且通用的复杂行为演化框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。