Skip to main content
QUICK REVIEW

[论文解读] Task-Agnostic Morphology Evolution

Donald J. Hejna, Pieter Abbeel|arXiv (Cornell University)|Feb 25, 2021
Reinforcement Learning in Robotics参考文献 37被引用 5
一句话总结

本文提出任务无关形态演化(TAME),一种无监督方法,仅通过随机采样的动作基元和基于信息论的适应度目标(衡量状态多样性与动作可预测性)来演化机器人形态。TAME 在无需奖励信号或策略训练的情况下,实现了与任务监督方法相当的多任务性能,从而在2D、3D及操作类环境中实现了快速、可泛化的形态设计。

ABSTRACT

Deep reinforcement learning primarily focuses on learning behavior, usually overlooking the fact that an agent's function is largely determined by form. So, how should one go about finding a morphology fit for solving tasks in a given environment? Current approaches that co-adapt morphology and behavior use a specific task's reward as a signal for morphology optimization. However, this often requires expensive policy optimization and results in task-dependent morphologies that are not built to generalize. In this work, we propose a new approach, Task-Agnostic Morphology Evolution (TAME), to alleviate both of these issues. Without any task or reward specification, TAME evolves morphologies by only applying randomly sampled action primitives on a population of agents. This is accomplished using an information-theoretic objective that efficiently ranks agents by their ability to reach diverse states in the environment and the causality of their actions. Finally, we empirically demonstrate that across 2D, 3D, and manipulation environments TAME can evolve morphologies that match the multi-task performance of those learned with task supervised algorithms. Our code and videos can be found at https://sites.google.com/view/task-agnostic-evolution.

研究动机与目标

  • 为解决当前形态优化方法依赖任务特定奖励和策略学习所导致的形态狭窄、难以泛化的问题。
  • 开发一种方法,使形态能够在无显式任务监督或行为学习的情况下,跨多个任务表现出色。
  • 设计一种基于内在探索与控制能力评估形态质量的适应度函数,独立于任务奖励。
  • 通过用随机动作采样和基于信息论的排序替代昂贵的策略优化,实现快速、可扩展的形态演化。
  • 证明任务无关的形态演化可达到任务监督方法在多样化环境中的多任务性能水平。

提出的方法

  • TAME 使用基于信息论的适应度目标,量化形态能够到达的多样化状态数量以及其动作导致状态转移的可预测性。
  • 适应度函数通过变分推理框架估计,其中神经网络 $ q_\phi $ 建模给定动作下状态的条件分布。
  • 形态通过正则化进化算法演化,定期重置 $ q_\phi $ 以防止对旧形态的过拟合。
  • 种群中的每个智能体通过在其形态上执行随机采样的动作基元并收集状态转移数据进行评估。
  • 动作基元为关节级,可根据环境特性选择,例如在操作任务中使用正弦信号,在运动任务中使用恒定力矩。
  • 图神经网络(GNNs)用于编码形态结构,实现对具有任意数量肢体的形态的端到端演化。

实验结果

研究问题

  • RQ1能否在不依赖任何任务特定奖励或策略训练的情况下有效优化形态?
  • RQ2如何设计一种任务无关的适应度函数,以衡量形态内在的探索与环境控制能力?
  • RQ3与监督行为学习相比,随机动作基元在多大程度上能提供足够的信号以实现有效的形态演化?
  • RQ4动作基元的选择在不同环境中如何影响所演化形态的性能?
  • RQ5TAME 能否演化出在多个任务间具有良好泛化能力的形态,并达到任务监督方法的性能水平?

主要发现

  • TAME 演化出的形态在2D运动、3D运动和操作环境中的多任务性能,与使用任务监督算法学习的形态相当。
  • 在2D运动环境中,TAME 使用余弦动作基元实现了平均回报 $ 700.4 \pm 42.8 $,优于恒定基元($ 610.4 \pm 76.6 $),并匹配了监督基线方法的性能。
  • 在3D运动环境中,TAME 使用余弦基元实现了 $ 533.5 \pm 38.7 $,显著优于恒定基元($ 412.0 \pm 36.8 $),并达到监督方法的性能水平。
  • 消融实验表明,每根关节使用多样化的动作基元至关重要——若所有关节使用相同基元,性能会退化至接近随机水平。
  • 若不执行 $ q_\phi $ 的周期性重置,适应度信号质量下降,导致演化性能降低;而将正则化系数 $ \lambda = 1 $ 时,会生成高适应度但控制性差的形态。
  • TAME 在所有任务中均优于 TAMR(非演化基线方法),证实演化搜索在发现高质量形态中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。