[论文解读] DexTransfer: Real World Multi-fingered Dexterous Grasping with Minimal Human Demonstrations
DexTransfer 提出了一种数据增强框架,利用极少的人体动作捕捉示范,为23自由度的Allegro机械手生成多样化且成功的抓取轨迹。通过将人体动作重定向至机器人、利用无梯度优化方法优化轨迹,并应用领域随机化,该方法使在模拟点云观测下训练的策略在真实世界抓取任务中实现了高达72%的成功率,适用于未见过的物体姿态和初始手部构型。
Teaching a multi-fingered dexterous robot to grasp objects in the real world has been a challenging problem due to its high dimensional state and action space. We propose a robot-learning system that can take a small number of human demonstrations and learn to grasp unseen object poses given partially occluded observations. Our system leverages a small motion capture dataset and generates a large dataset with diverse and successful trajectories for a multi-fingered robot gripper. By adding domain randomization, we show that our dataset provides robust grasping trajectories that can be transferred to a policy learner. We train a dexterous grasping policy that takes the point clouds of the object as input and predicts continuous actions to grasp objects from different initial robot states. We evaluate the effectiveness of our system on a 22-DoF floating Allegro Hand in simulation and a 23-DoF Allegro robot hand with a KUKA arm in real world. The policy learned from our dataset can generalize well on unseen object poses in both simulation and the real world
研究动机与目标
- 解决因高维状态与动作空间导致的灵巧机器人抓取策略训练中人类示范数据有限的问题。
- 通过利用小型动作捕捉数据集,克服为多指机械手收集大规模人类示范的瓶颈。
- 开发可扩展的数据增强流水线,在仿真环境中生成多样化且成功的轨迹,以提升策略泛化能力。
- 实现从仿真中训练的策略向真实机器人系统稳健迁移,包括未见过的物体姿态和初始手部构型。
- 证明基于点云观测并预测连续动作的端到端方法显著优于固定姿态基线方法。
提出的方法
- 使用非线性优化框架将人体动作捕捉数据重定向至模拟的灵巧机器人手,同时保持手指与物体相对位姿动力学的一致性。
- 将重定向问题建模为代价最小化问题,结合手指关节位移、物体相对位姿以及手掌朝向对齐,并通过加权平衡保真度与可行性。
- 利用局部无梯度优化方法对重定向后的轨迹进行精细化处理,以提升成功率并确保仿真中的动力学可行性。
- 通过扰动物体姿态和初始手部构型实施定向数据增强,以提升数据集多样性与泛化能力。
- 训练一个深度强化学习策略,将三维点云映射为连续关节动作,实现从原始传感输入的端到端抓取。
- 将学习到的策略迁移到配备PD控制手部的23自由度KUKA Allegro机械臂上,采用几何织物控制器实现高层位姿跟踪与低层关节控制。
实验结果
研究问题
- RQ1少量人类示范是否可被有效重用于训练灵巧抓取策略,使其在仿真和真实世界中对未见过的物体姿态具有泛化能力?
- RQ2与直接重定向示范相比,轨迹优化与数据增强在多大程度上提升了策略的成功率?
- RQ3领域随机化在实现从仿真到真实机器人硬件的零样本迁移方面有多有效?
- RQ4在点云观测上训练的策略是否优于固定构型策略或最近邻基线方法?
- RQ5从点云中学习连续动作与预设手指姿态相比,对真实世界抓取性能有何影响?
主要发现
- 所提出的DexTransfer系统在真实世界未见过的物体姿态上实现了72%的成功率,显著优于基线方法。
- 基于点云输入并预测连续动作的策略仅实现11%的成功率,表明自适应控制相比固定姿态具有必要性。
- 最近邻基线方法仅达到14%的成功率,表明所学策略具备超越记忆化的能力,可泛化至新型物体与手部构型。
- 在仿真中,策略对未见过的物体姿态和初始机器人状态均表现出良好泛化能力,证实其对分布偏移的鲁棒性。
- 真实世界成功率在所有测试物体上均超过40%,部分达到70%,验证了领域随机化与数据增强的有效性。
- 该系统成功将仿真中训练的策略迁移到23自由度的KUKA Allegro机器人手,支持RGB-D感知与高层几何织物控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。