[论文解读] Multi-skill Mobile Manipulation for Object Rearrangement
本文提出 M3,一种多技能移动操作框架,通过将静态操作技能替换为可移动操作技能,并引入区域目标导航奖励,以提升长时序物体重排任务中的鲁棒性。通过使操作技能具备移动能力,并训练导航策略以灵活区域为目标而非固定点,M3 在 Home Assistant 基准测试中实现了跨配置任务 71.2% 的成功率和跨布局任务 55.0% 的成功率,显著优于所有基线方法。
We study a modular approach to tackle long-horizon mobile manipulation tasks for object rearrangement, which decomposes a full task into a sequence of subtasks. To tackle the entire task, prior work chains multiple stationary manipulation skills with a point-goal navigation skill, which are learned individually on subtasks. Although more effective than monolithic end-to-end RL policies, this framework suffers from compounding errors in skill chaining, e.g., navigating to a bad location where a stationary manipulation skill can not reach its target to manipulate. To this end, we propose that the manipulation skills should include mobility to have flexibility in interacting with the target object from multiple locations and at the same time the navigation skill could have multiple end points which lead to successful manipulation. We operationalize these ideas by implementing mobile manipulation skills rather than stationary ones and training a navigation skill trained with region goal instead of point goal. We evaluate our multi-skill mobile manipulation method M3 on 3 challenging long-horizon mobile manipulation tasks in the Home Assistant Benchmark (HAB), and show superior performance as compared to the baselines.
研究动机与目标
- 解决长时序移动操作任务中技能链式执行时的误差累积问题。
- 通过使操作技能具备移动能力,提升模块化技能的鲁棒性与可组合性。
- 通过用区域目标导航替代点目标导航,减少导航目标的模糊性。
- 通过改进技能设计,提升在未见环境(跨布局)中的泛化能力与成功率。
- 建立设计原则——可实现性、可组合性与可重用性——以在具身人工智能中实现有效的子任务分解。
提出的方法
- 将静态操作技能替换为可在任务执行过程中移动底盘的移动操作技能。
- 引入区域目标导航奖励,定义可行的目标区域而非固定点目标,提升导航鲁棒性。
- 训练导航策略以到达目标区域内的任意位置,降低对精确初始导航的依赖。
- 在导航奖励中引入碰撞惩罚,避免与环境发生非预期交互(例如过早关闭门)。
- 通过模块化技能层级,将移动操作技能与区域目标导航进行链式组合,实现灵活且抗错的任务执行。
- 基于可实现性与可组合性之间的权衡,制定操作技能的初始状态分布,避免不切实际或过于宽泛的分布。
实验结果
研究问题
- RQ1与静态技能相比,移动操作技能是否能减少技能链式执行中的误差累积?
- RQ2与点目标导航相比,使用区域目标导航在多大程度上提升了策略的泛化能力与成功率?
- RQ3在不降低性能的前提下,操作技能的初始状态分布可扩展到何种程度?
- RQ4在导航奖励中增加碰撞惩罚是否能提升环境交互安全性与任务成功率?
- RQ5所提出方法在跨配置与跨布局泛化设置下的表现如何?
主要发现
- M3 在 Home Assistant 基准测试的跨配置设置中实现 71.2% 的成功率,在跨布局设置中实现 55.0% 的成功率,显著优于所有基线方法。
- 采用移动操作方法(M+P)在跨配置任务中实现 64.9% 的成功率,在跨布局任务中实现 36.2% 的成功率,显著优于静态基线方法(S+P)的 57.4% 和 31.1%。
- 在导航奖励中增加碰撞惩罚后,成功率从 57.4% 提升至 65.2%(S+P 对比 S+P(C)),以及从 64.9% 提升至 67.9%(M+P 对比 M+P(C)),表明该机制对安全交互至关重要。
- 消融实验表明,单纯扩展静态技能的初始状态分布(S(L)+P)会使 TidyHouse 中 Pick 任务的成功率从 95% 降至 45%,表明盲目扩展可行性差。
- 区域目标导航奖励显著提升了跨布局设置下的泛化能力,M3 实现 55.0% 的成功率,而 M+P 仅为 36.2%,凸显目标指定模糊性的降低。
- 定性结果表明,移动操作可通过重新定位来纠正不精确的导航,从而访问目标;而静态操作在导航落点不佳时则会失败。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。