[论文解读] Learning Purely Tactile In-Hand Manipulation with a Torque-Controlled Hand
本论文提出了一种首个成功的、基于学习的纯触觉在手操作策略,适用于力矩控制的人形机械手,通过使用领域自适应课程的离策略深度强化学习在仿真环境中进行训练。该策略仅依赖关节位置和力矩反馈,即可实现鲁棒的连续2π旋转,即使在存在扰动且无视觉反馈或外部状态估计的情况下,也在真实世界实验中实现了超过46次的完整旋转。
We show that a purely tactile dextrous in-hand manipulation task with continuous regrasping, requiring permanent force closure, can be learned from scratch and executed robustly on a torque-controlled humanoid robotic hand. The task is rotating a cube without dropping it, but in contrast to OpenAI's seminal cube manipulation task, the palm faces downwards and no cameras but only the hand's position and torque sensing are used. Although the task seems simple, it combines for the first time all the challenges in execution as well as learning that are important for using in-hand manipulation in real-world applications. We efficiently train in a precisely modeled and identified rigid body simulation with off-policy deep reinforcement learning, significantly sped up by a domain adapted curriculum, leading to a moderate 600 CPU hours of training time. The resulting policy is robustly transferred to the real humanoid DLR Hand-II, e.g., reaching more than 46 full 2$π$ rotations of the cube in a single run and allowing for disturbances like different cube sizes, hand orientation, or pulling a finger.
研究动机与目标
- 开发一种完全基于触觉的在手操作策略,不依赖视觉反馈或外部物体状态估计。
- 解决在持续力封闭条件下连续重新抓握的挑战,该条件限制了学习过程中的探索能力。
- 实现在高自由度人形机器人手上复杂触觉操作任务的高效模拟到现实的迁移。
- 展示对真实世界扰动(如手部方向改变、手指拉扯、立方体尺寸变化)的鲁棒性。
- 仅使用DLR Hand-II内置的关节和力矩传感器,实现超过46次完整旋转的长时程操作。
提出的方法
- 在高保真的刚体仿真环境中使用离策略软演员评论家(SAC)训练深度强化学习策略,该环境模拟了DLR Hand-II的力矩控制阻抗特性。
- 集成了一种领域自适应课程,通过调整仿真超参数(如滤波常数、重力)来加速收敛并提升模拟到现实的迁移性能。
- 仅使用内置的关节位置和输出侧力矩传感器读数作为观测输入,无需外部状态估计或视觉系统。
- 实现了高保真的仿真模型,通过力控制器抽象捕捉传动系统弹性及粘滑摩擦特性。
- 应用领域随机化和仿真辨识技术以增强鲁棒性,并确保真实世界中的准确迁移。
- 通过延续训练对策略进行微调,使其能够成功操作非立方体物体(如已知几何形状的长方体)。
实验结果
研究问题
- RQ1能否从零开始训练一个完全基于触觉的在手操作策略,并成功迁移到真实的力矩控制人形机械手上,而无需视觉反馈?
- RQ2当必须维持抓握以保持力封闭时,如何有效学习在持续力封闭条件下的连续重新抓握?
- RQ3领域自适应课程在加速训练和提升触觉操作任务的模拟到现实迁移方面起到了何种作用?
- RQ4所学习的策略在多大程度上能应对真实世界扰动,如手指拉扯、手部重新定向和物体尺寸变化?
- RQ5在立方体上训练的策略是否可通过微调推广到其他已知形状的物体(如长方体)?
主要发现
- 该策略在单次真实世界运行中实现了超过46次完整的2π旋转(289 rad),展示了卓越的长时程稳定性。
- 在10次真实世界实验中,有8次成功,成功阈值为最佳仿真性能的80%,证实了强大的模拟到现实迁移能力。
- 该策略优于开环手工设计的轨迹和重放的关节角序列,后者仅在旋转π/2弧度后即因不稳定而失败。
- 该策略对未见过的扰动表现出鲁棒性,包括手指拉扯、手部重新定向以及高达2厘米的立方体尺寸变化。
- 通过使用连杆侧力矩传感器,策略能够检测并从抓握失败中恢复,通过感知控制误差实现闭环自适应。
- 微调使策略能够成功操作长方体,将方法从原始立方体任务扩展至任意已知几何形状。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。