Skip to main content
QUICK REVIEW

[论文解读] Arbitrarily Scalable Environment Generators via Neural Cellular Automata

Yulun Zhang, Matthew C. Fontaine|arXiv (Cornell University)|Oct 28, 2023
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出通过质量多样性(QD)算法训练神经元胞自动机(NCA)生成器,以创建可任意扩展的仓库环境,适用于多机器人系统。该方法不直接优化大规模环境,而是在小规模环境中训练NCA生成器,从而实现大尺寸、一致且可扩展的布局生成,具备高吞吐量——在实验中已成功支持高达2,350台机器人——同时性能与先前方法相当或更优,并在大规模场景下显著优于人工设计的布局。

ABSTRACT

We study the problem of generating arbitrarily large environments to improve the throughput of multi-robot systems. Prior work proposes Quality Diversity (QD) algorithms as an effective method for optimizing the environments of automated warehouses. However, these approaches optimize only relatively small environments, falling short when it comes to replicating real-world warehouse sizes. The challenge arises from the exponential increase in the search space as the environment size increases. Additionally, the previous methods have only been tested with up to 350 robots in simulations, while practical warehouses could host thousands of robots. In this paper, instead of optimizing environments, we propose to optimize Neural Cellular Automata (NCA) environment generators via QD algorithms. We train a collection of NCA generators with QD algorithms in small environments and then generate arbitrarily large environments from the generators at test time. We show that NCA environment generators maintain consistent, regularized patterns regardless of environment size, significantly enhancing the scalability of multi-robot systems in two different domains with up to 2,350 robots. Additionally, we demonstrate that our method scales a single-agent reinforcement learning policy to arbitrarily large environments with similar patterns. We include the source code at \url{https://github.com/lunjohnzhang/warehouse_env_gen_nca_public}.

研究动机与目标

  • 为解决多机器人系统环境优化中的可扩展性瓶颈问题,即先前的质量多样性(QD)方法因环境规模增大导致搜索空间呈指数级增长而失效。
  • 实现在无需直接优化大规模布局的前提下,生成可任意扩展、规则化且高吞吐量的仓库环境。
  • 通过在小规模环境上训练NCA生成器,并在推理阶段将其扩展至大规模,降低计算成本,减少对昂贵的MILP修复的依赖,以应对大规模布局的约束。
  • 证明NCA生成的环境在大规模仿真(最多支持2,350台机器人)中,能保持一致的模式,且在可扩展性方面优于人工设计或直接优化的布局。
  • 在两个领域(仓库和制造)中验证该方法,展示其在性能和可扩展性方面的持续优势。

提出的方法

  • 在小规模环境(如36×33)上,使用质量多样性(QD)算法(如CMA-MAE和CMA-ES)训练一组多样化的神经元胞自动机(NCA)生成器,以学习生成模式的规则。
  • 利用QD算法基于多个目标(如吞吐量和模式多样性)优化NCA生成器,避免陷入局部最优,确保鲁棒性。
  • 在推理阶段,从训练好的NCA生成器生成任意大规模环境,利用胞自动机的局部、规则化更新机制实现天然可扩展性。
  • 仅对每个大规模环境执行一次混合整数线性规划(MILP)求解器,用于修复领域特定约束(如连通性、存储容量),从而最小化计算开销。
  • 使用基于智能体的仿真器评估生成的环境,测量吞吐量和成功率,指标基于多次仿真运行结果报告。
  • 使用相似性分数评估小规模与大规模生成环境之间的模式一致性,确保跨尺度的结构保真度。

实验结果

研究问题

  • RQ1通过QD算法训练的NCA生成器能否生成可任意扩展的仓库环境,并在不同尺寸下保持一致且规则化的模式?
  • RQ2在大规模多机器人仿真中,所提方法是否在吞吐量和可扩展性方面优于先前经QD优化的环境及人工设计的布局?
  • RQ3使用注重多样性的QD算法(如CMA-MAE)与单目标优化器(如CMA-ES)相比,在训练NCA生成器以实现可扩展性和鲁棒性方面表现如何?
  • RQ4单个训练好的NCA生成器在多大程度上能泛化以生成与直接优化的小规模环境性能相似的大规模环境?
  • RQ5该方法能否将单智能体强化学习策略成功扩展至任意大规模环境,并保持原有的性能模式?

主要发现

  • 在仓库(不规则)领域,CMA-MAE + NCA在规模S下实现100%成功率和6.82 ± 0.00的吞吐量,在规模S_eval下实现84%成功率和12.03 ± 0.00吞吐量,其可扩展性优于CMA-ES。
  • 在制造领域,CMA-MAE + NCA在规模S_eval下实现100%成功率和23.11 ± 0.01吞吐量,显著优于CMA-ES(在计算预算内未能找到解)。
  • 在仓库(规则)领域,CMA-ES + NCA在规模S_eval下未能实现任何成功运行(0%成功率),而CMA-MAE + NCA实现90%成功率和16.01 ± 0.00吞吐量。
  • 未经修复的CMA-ES生成的NCA环境表现出高终点密度和差的约束满足度,导致MILP修复失败并陷入局部最优;而CMA-MAE的多样性感知训练有效避免了此类问题。
  • 该方法成功将环境扩展至2,350台机器人,证明NCA生成器在不同尺度下能保持一致且规则化的模式,从而实现高吞吐量的多机器人协同。
  • 该方法显著降低了对重复MILP修复的依赖:每个大规模环境仅需在生成后修复一次,与先前方法相比,计算成本大幅降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。