[论文解读] Bingham Policy Parameterization for 3D Rotations in Reinforcement Learning
该论文提出了一种新型的3D旋转强化学习策略参数化方法——宾丁策略参数化(Bingham Policy Parameterization, BPP),用更适合单位范数四元数的宾丁分布替代了标准的高斯分布。BPP在旋转控制和6D位姿控制任务中表现更优,包括Wahba问题和基于视觉的RLBench机械臂操作任务,通过实现更自然的探索和对四元数的精确不确定性建模,显著提升了性能。
We propose a new policy parameterization for representing 3D rotations during reinforcement learning. Today in the continuous control reinforcement learning literature, many stochastic policy parameterizations are Gaussian. We argue that universally applying a Gaussian policy parameterization is not always desirable for all environments. One such case in particular where this is true are tasks that involve predicting a 3D rotation output, either in isolation, or coupled with translation as part of a full 6D pose output. Our proposed Bingham Policy Parameterization (BPP) models the Bingham distribution and allows for better rotation (quaternion) prediction over a Gaussian policy parameterization in a range of reinforcement learning tasks. We evaluate BPP on the rotation Wahba problem task, as well as a set of vision-based next-best pose robot manipulation tasks from RLBench. We hope that this paper encourages more research into developing other policy parameterization that are more suited for particular environments, rather than always assuming Gaussian.
研究动机与目标
- 解决高斯策略参数化在3D旋转动作空间中的局限性,因为高斯分布采样在四元数上存在对称性和双峰性问题,不适用。
- 探究是否使用天然适用于旋转的分布(如宾丁分布)能在连续控制强化学习中提升旋转与位姿预测任务的性能。
- 证明将高斯策略头替换为宾丁策略头,可在简单与复杂机器人控制环境中带来可测量的性能提升。
- 鼓励强化学习社区重新审视高斯参数化的普遍使用,转而开发针对任务几何结构的专用分布策略参数化方法。
- 在多样化设置下验证该方法的有效性:包括仅旋转任务(Wahba问题)、基于视觉的下一最佳位姿操作任务,以及具有挑战性的基于图像、稀疏奖励的RLBench设置。
提出的方法
- 将标准高斯策略输出(均值与对数方差)替换为宾丁分布的参数,特别是定义其在3-球面上形状的集中参数 $ z_1, z_2, z_3 $。
- 使用神经网络预测宾丁分布参数 $ z_1, z_2, z_3 $,并施加约束 $ z_1 \leq z_2 \leq z_3 \leq 0 $,以确保参数有序性与数值稳定性。
- 在探索过程中使用拒绝采样从宾丁分布生成有效的四元数样本,支持随机策略的轨迹 rollout。
- 通过修改策略头以输出宾丁参数,同时保留翻译和夹爪动作的高斯参数化,将宾丁策略集成到SAC和PPO等成熟强化学习算法中。
- 利用神经网络近似对数归一化常数与归一化常数,以计算对数概率与熵,这对策略梯度更新至关重要。
- 在需要3D旋转或6D位姿控制的环境中训练与评估BPP策略,包括Wahba问题与RLBench任务,在密集奖励与稀疏奖励设置下均进行测试。
实验结果
研究问题
- RQ1能否通过将高斯策略参数化替换为宾丁分布,提升在动作空间受限于单位四元数的3D旋转控制任务中的性能?
- RQ2由于宾丁分布本身具有对称性且定义在3-球面上,是否能为旋转任务提供比高斯采样更优的探索与策略优化?
- RQ3BPP在具有视觉观测的复杂、高维且稀疏奖励的机器人操作任务中表现如何?
- RQ4BPP的优势能否从简单、低维环境扩展到具有挑战性的、类真实世界的机器人控制基准(如RLBench)?
- RQ5在强化学习中使用宾丁分布面临哪些实际挑战,特别是归一化常数近似与数值稳定性方面?
主要发现
- 在仅旋转的Wahba问题中,BPP显著优于高斯策略参数化(GPP),由于对四元数不确定性建模更优,实现了更快的收敛速度与更高的最终性能。
- 在RLBench的基于视觉的下一最佳位姿任务中,SAC(BPP)与PPO(BPP)的成功率高于其对应的高斯策略版本,表明在复杂观测空间中具有更强的泛化能力与探索性能。
- 在最具有挑战性的RLBench设置中(稀疏奖励与高维图像观测),SAC与PPO使用GPP无法有效学习,而BPP仍能保持性能优势。
- 将ARM(一种先进的模仿-强化学习算法)与BPP结合(ARM(BPP))后,相比ARM(GPP),实现了更高的样本效率与最终性能,证实了BPP在先进强化学习框架中的可扩展性。
- 结果表明,策略参数化的选择对几何动作空间至关重要,非高斯分布如宾丁分布可在旋转敏感任务中显著提升性能。
- 尽管结果表现优异,但通过神经网络近似归一化常数可能引入数值不稳定性,提示未来工作需开发更鲁棒的估计方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。