[论文解读] Optical Tactile Sim-to-Real Policy Transfer via Real-to-Sim Tactile Image Translation.
本文提出了一种基于真实到模拟触觉图像转换的触觉机器人仿真到现实策略迁移框架,实现了在真实机器人上零样本部署仿真训练的策略。通过在仿真中将高分辨率光学触觉传感器模拟为深度图像,并利用数据驱动方法将真实触觉传感器数据转换为对应的仿真数据,该方法在物理操作任务中成功执行了由PPO训练的策略。
Simulation has recently become key for deep reinforcement learning to safely and efficiently acquire general and complex control policies from visual and proprioceptive inputs. Tactile information is not usually considered despite its direct relation to environment interaction. In this work, we present a suite of simulated environments tailored towards tactile robotics and reinforcement learning. A simple and fast method of simulating optical tactile sensors is provided, where high-resolution contact geometry is represented as depth images. Proximal Policy Optimisation (PPO) is used to learn successful policies across all considered tasks. A data-driven approach enables translation of the current state of a real tactile sensor to corresponding simulated depth images. This policy is implemented within a real-time control loop on a physical robot to demonstrate zero-shot sim-to-real policy transfer on several physically-interactive tasks requiring a sense of touch.
研究动机与目标
- 通过实现从仿真到真实世界机器人控制的策略迁移,弥合触觉强化学习中的仿真到现实差距。
- 开发一种快速且准确的方法,利用接触几何的高分辨率深度图像模拟光学触觉传感器。
- 通过将真实触觉传感器观测转换为对应的仿真传感器输入,实现实时策略在物理机器人上的部署。
- 在需要触觉感知的物理交互任务上展示该方法的有效性。
提出的方法
- 通过在仿真中从详细的接触几何体渲染高分辨率深度图像来模拟光学触觉传感器。
- 训练一种数据驱动的转换模型,将真实触觉传感器图像转换为对应的仿真深度图像。
- 使用近端策略优化(PPO)算法,基于视觉和本体感觉观测在仿真中训练控制策略。
- 将触觉转换模型集成到实时控制回路中,实现在真实机器人上的零样本策略迁移。
- 设计一套专为触觉机器人和复杂操作任务定制的仿真环境。
- 通过图像转换对齐真实传感器观测与仿真观测,实现端到端的策略部署。
实验结果
研究问题
- RQ1真实到模拟的触觉图像转换是否能够实现在触觉机器人中的零样本仿真到现实策略迁移?
- RQ2所提出的光学触觉传感器仿真方法在捕捉高保真接触几何方面有多有效?
- RQ3当使用转换后的触觉观测在真实机器人上部署时,PPO训练的策略性能如何?
- RQ4该策略迁移在需要触觉感知的多样化物理交互任务中有多强的鲁棒性?
主要发现
- 所提出的方法成功实现了在多个需要触觉反馈的物理交互任务中实现零样本仿真到现实的策略迁移。
- 数据驱动的触觉图像转换模型能有效对齐真实触觉传感器数据与仿真深度图像,从而实现精确的策略部署。
- 当使用转换后的触觉观测时,PPO训练的策略在从仿真到真实世界的泛化能力表现良好。
- 仿真框架通过接触几何的深度图像表示,支持高保真的光学触觉传感。
- 实时控制回路的集成证明了在无需微调的情况下,将学习到的策略部署在物理机器人上的可行性。
- 该方法在无需仿真到现实领域随机化或额外适应的情况下,实现了多个触觉操作任务的可靠任务执行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。