[论文解读] Learning Robust Bed Making using Deep Imitation Learning with DART
本文提出了一种基于深度模仿学习与DART的鲁棒床铺整理系统,该方法通过在人类示范采集过程中模拟机器人错误,提升了策略的泛化能力。在使用DART收集50组示范数据后,机器人即使在存在干扰物的情况下仍实现了96%的被单覆盖度,相比基于角点检测的基线方法提升了200%。
Bed-making is a universal home task that can be challenging for senior citizens due to reaching motions. Automating bed-making has multiple technical challenges such as perception in an unstructured environments, deformable object manipulation, obstacle avoidance and sequential decision making. We explore how DART, an LfD algorithm for learning robust policies, can be applied to automating bed making without fiducial markers with a Toyota Human Support Robot (HSR). By gathering human demonstrations for grasping the sheet and failure detection, we can learn deep neural network policies that leverage pre-trained YOLO features to automate the task. Experiments with a 1/2 scale twin bed and distractors placed on the bed, suggest policies learned on 50 demonstrations with DART achieve 96% sheet coverage, which is over 200% better than a corner detector baseline using contour detection.
研究动机与目标
- 解决为老年人自动化床铺整理的挑战,因其任务对身体要求较高。
- 克服在非结构化环境中面临的技术难题,包括可变形物体操作、障碍物避让以及顺序决策。
- 提升策略对现实世界扰动(如床上的家用物品和光照变化)的鲁棒性。
- 通过利用预训练的YOLO特征进行迁移学习,减少对大规模示范数据集的依赖。
- 通过DART在示范数据采集过程中模拟并训练对微小错误的恢复能力,缓解模仿学习中的协变量偏移问题。
提出的方法
- 使用丰田HSR机器人通过抓取并拉动被单角落至床架的方式完成床铺整理。
- 利用人类示范训练深度神经网络策略,用于抓取选择和状态转换成功检测。
- 利用预训练的YOLO特征进行视觉状态表征,以提升样本效率。
- 应用DART(带鲁棒训练的DART数据集聚合)方法,在人类示范中注入小而优化的噪声,以在数据采集过程中模拟机器人错误。
- 采用离策略模仿学习训练策略,使其能够泛化到未见过的状态并从偏差中恢复。
- 集成机器人的内部运动规划器以控制身体运动,将模仿学习的重点集中在基于视觉的决策组件上。
实验结果
研究问题
- RQ1机器人是否能在无标识标记的情况下,有效应对常见家庭干扰物,实现鲁棒的床铺整理?
- RQ2与标准行为克隆相比,DART在可变形物体操作的模仿学习中如何提升策略泛化能力?
- RQ3从预训练的YOLO特征进行迁移学习,能在多大程度上减少床铺整理任务所需的示范数量?
- RQ4在示范数据采集过程中注入模拟错误,如何减少协变量偏移并提升真实世界性能?
- RQ5在存在干扰物的条件下,DART训练的策略相比基于轮廓的启发式方法(如角点检测)在性能上有多大提升?
主要发现
- DART训练的策略在存在干扰物(如毛绒玩具、玩具)的半尺度床铺上实现了96%的被单覆盖度,相比使用轮廓检测的角点检测基线方法提升了200%。
- 在无干扰物的情况下,DART训练的策略在被单覆盖度上与人工监督者相比仅相差2%,表现出高度保真的模仿能力。
- 与标准行为克隆仅暴露于2种故障模式相比,DART通过在数据采集过程中让监督者接触27种故障模式,显著降低了策略在机器人实际执行分布上的误差。
- 由于在训练过程中接触了更丰富的视觉状态多样性,使用DART训练的抓取策略在未见过的状态上泛化能力更强。
- 与行为克隆相比,使用DART训练的过渡策略在机器人实际分布上的误差显著更低,表明协变量偏移问题得到明显缓解。
- 尽管每组示范平均耗时多30秒,但由于引入的错误微小且可恢复,DART在数据采集过程中仍保持了98%的被单覆盖度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。