Skip to main content
QUICK REVIEW

[论文解读] Robotic Table Tennis with Model-Free Reinforcement Learning

Wenbo Gao, Laura Graesser|arXiv (Cornell University)|Mar 31, 2020
Reinforcement Learning in Robotics参考文献 42被引用 5
一句话总结

该论文提出了一种无需模型的强化学习方法,用于机器人乒乓球控制,采用进化策略(ES)训练一种关节空间策略,以100Hz的频率控制6自由度机械臂。该方法在不依赖球体轨迹建模或人类示范的情况下,通过课程学习和时间卷积网络,学习到双模式的正手与反手击球动作,实现了80%的球返回率,从而生成了平滑且紧凑的策略。

ABSTRACT

We propose a model-free algorithm for learning efficient policies capable of returning table tennis balls by controlling robot joints at a rate of 100Hz. We demonstrate that evolutionary search (ES) methods acting on CNN-based policy architectures for non-visual inputs and convolving across time learn compact controllers leading to smooth motions. Furthermore, we show that with appropriately tuned curriculum learning on the task and rewards, policies are capable of developing multi-modal styles, specifically forehand and backhand stroke, whilst achieving 80\% return rate on a wide range of ball throws. We observe that multi-modality does not require any architectural priors, such as multi-head architectures or hierarchical policies.

研究动机与目标

  • 开发一种无需依赖预测球体模型或人类示范的无模型强化学习策略,实现在100Hz频率下对高速机器人乒乓球控制的端到端学习。
  • 探究在不使用多头或分层策略等架构先验的情况下,多模态击球风格(如正手与反手)是否能在端到端强化学习中自然涌现。
  • 评估时间卷积网络在非视觉输入上的表现,与全连接网络相比,是否能更有效地学习到平滑且紧凑的策略。
  • 设计一种课程学习策略,以实现对双模态策略的高效训练,同时避免风格坍缩和局部最优。
  • 证明密集奖励(如到台距离)和奖励塑形可提升学习效率,且不损害策略多样性或性能。

提出的方法

  • 使用进化策略(ES)训练策略网络,基于关节位置和球体位置的短期历史状态,在100Hz实时频率下优化关节速度。
  • 采用一维卷积神经网络(CNN),在时间维度上处理非视觉的本体感觉和球体状态输入,以学习时间动态并生成平滑的控制输出。
  • 采用课程学习调度:初始阶段使用标准姿态奖励和DCPS(双标准姿态塑形)在全台范围内训练,随后逐步引入DTR(到台距离)密集成功奖励,初始球体范围限制在(0.5, 0.7),再逐步扩展至全台覆盖。
  • 通过两种关键奖励实现奖励塑形:(1) DCPS用于鼓励稳定、双臂协同风格的姿态;(2) DTR用于基于靠近对手球台距离的密集成功信号。
  • 通过分布塑形实现:逐步扩大球体落点分布范围,从(0.5, 0.7)扩展至(0.3, 0.7),最终扩展至全台,以避免局部极小值并促进双模态行为。
  • 结合稀疏成功奖励(返回成功+1.0)与密集DTR奖励,以在高成功率区域实现探索突破并逃离平台期。

实验结果

研究问题

  • RQ1无模型强化学习策略是否能在不依赖预测球体模型或人类示范的前提下,实现100Hz频率下对乒乓球的返回?
  • RQ2在不使用多头或分层策略等架构先验的端到端强化学习中,多模态击球(如正手与反手)是否能自然涌现?
  • RQ3在高速机器人控制中,对非视觉输入使用时间卷积网络是否能相比全连接网络生成更平滑、更紧凑的策略?
  • RQ4结合奖励塑形与分布迁移的课程学习在训练双模态策略、避免风格坍缩方面的有效性如何?
  • RQ5在高精度机器人任务中,密集奖励(如DTR)与稀疏奖励对策略多样性与收敛性的影响是什么?

主要发现

  • 所提出的无模型强化学习方法在各类球体投掷条件下实现了80%的返回率,证明了其在无需球体轨迹建模情况下的强大性能。
  • 结合课程学习与奖励塑形训练的策略,成功学习到无需架构先验的双模态正手与反手击球风格。
  • 在非视觉输入上使用时间CNN相比MLP能生成更平滑、更紧凑的策略,且在ES训练范式中尤为有效。
  • 过早引入DTR密集奖励会导致单模态策略坍缩,凸显了奖励设计对策略风格涌现的敏感性。
  • 通过逐步扩大球体落点分布范围(从(0.5, 0.7)扩展至全台)的分布塑形策略,显著提升了训练稳定性和双模态策略学习效果。
  • 在初始双模态策略建立后,引入DCPS姿态奖励与DTR成功奖励的组合,可持续提升成功率,同时保持双模态行为特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。