[论文解读] Hardware as Policy: Mechanical and Computational Co-Optimization using Deep Reinforcement Learning
本文提出了'硬件即策略'(HWasP)框架,一种通过将硬件参数建模为统一计算图中的可微分组件,实现机械硬件与计算控制策略联合优化的深度强化学习方法。通过实现对硬件与控制参数的基于梯度的优化,HWasP在收敛速度和性能上均优于超参数调优与进化策略,其有效性已在质量-弹簧系统仿真与一款真实3D打印的欠驱动机械手原型中得到验证,该机械手对盒子和球体实现了100%的抓取成功率。
Deep Reinforcement Learning (RL) has shown great success in learning complex control policies for a variety of applications in robotics. However, in most such cases, the hardware of the robot has been considered immutable, modeled as part of the environment. In this study, we explore the problem of learning hardware and control parameters together in a unified RL framework. To achieve this, we propose to model the robot body as a "hardware policy", analogous to and optimized jointly with its computational counterpart. We show that, by modeling such hardware policies as auto-differentiable computational graphs, the ensuing optimization problem can be solved efficiently by gradient-based algorithms from the Policy Optimization family. We present two such design examples: a toy mass-spring problem, and a real-world problem of designing an underactuated hand. We compare our method against traditional co-optimization approaches, and also demonstrate its effectiveness by building a physical prototype based on the learned hardware parameters. Videos and more details are available at https://roamlab.github.io/hwasp/ .
研究动机与目标
- 为解决传统强化学习中将机器人硬件视为不可变因素的局限性,即仅学习控制策略。
- 通过基于梯度的方法实现机械设计与控制策略的联合优化,克服进化策略中的样本效率低下问题。
- 证明将硬件建模为可微分策略可实现高效、可扩展的机器人系统联合设计。
- 在简单机械系统与真实世界欠驱动机械手原型上验证该方法,实现物理部署。
- 建立一个框架,使硬件与软件联合设计可基于标准强化学习工具包完成,仅需极少算法修改。
提出的方法
- 将硬件参数(如齿轮比、弹簧刚度)作为可学习参数嵌入可微分计算图中,类似于神经网络权重。
- 采用策略梯度方法对整个系统(包括计算策略与硬件策略)进行端到端训练,梯度通过符合物理规律的计算图反向传播。
- 利用自动可微分的物理仿真器,计算策略性能相对于控制参数与硬件参数的梯度。
- 提出一种简化变体(HWasP-Minimal),用于在非可微分物理引擎中测试该方法,采用基于采样的策略梯度而非解析梯度。
- 该框架支持单任务与多任务优化,具备扩展至运动学、形态学与传感器设计的潜力。
- 通过在标准强化学习算法(如PPO)中引入包含硬件参数的修改版计算图,对方法进行评估。
实验结果
研究问题
- RQ1能否通过基于梯度的强化学习有效优化硬件参数与控制策略?
- RQ2基于梯度的联合优化在硬件-软件联合设计中的性能,相较于超参数调优与进化策略如何?
- RQ3可微分物理在多大程度上能实现机械与计算组件的更快、更高效联合设计?
- RQ4联合优化的硬件与控制策略在仿真与真实世界中,能否在多种物体形状与抓取任务中实现泛化?
- RQ5物理可微分性的引入如何影响联合设计过程的可扩展性与鲁棒性?
主要发现
- 在质量-弹簧系统与机械手设计任务中,HWasP均实现了比超参数调优与无梯度进化策略更快的收敛速度与更高的性能。
- 基于HWasP优化硬件参数的3D打印欠驱动机械手物理原型,在真实世界实验中成功实现了对盒子、球体与圆柱体的稳定抓取。
- 优化后的机械手在Z-Grasp任务中对盒子与球体实现了100%成功率,对圆柱体为90%;在3D-Grasp任务中对盒子成功率为100%,对圆柱体为80%。
- 由于早期接触导致的物体位移,3D-Grasp在球体上的成功率为50%,凸显了真实世界感知中的挑战。
- HWasP-Minimal(采用基于采样的梯度)性能至少与最佳进化基线相当,表明即使在缺乏自动可微分物理引擎的情况下,该方法仍具备广泛适用性。
- 该框架通过允许算法设计者调节物理可微分程度,实现了高效的联合设计,平衡了计算成本与实现便捷性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。