[论文解读] Adversarial Skill Chaining for Long-Horizon Robot Manipulation via Terminal State Regularization
本文提出 T-STAR,一种对抗性技能链框架,通过终端状态正则化使子任务策略的终止分布接近后续策略的启动集合,从而防止所需状态覆盖范围的级联增长。该方法实现了首个无需模型的强化学习解决方案,用于复杂 IKEA 家具组装任务,在 chair_ingolf 和 table_lack 任务上分别取得 56% 和 87% 的成功率,优于以往的技能链基线方法,后者完全失败或仅取得较低成功率。
Skill chaining is a promising approach for synthesizing complex behaviors by sequentially combining previously learned skills. Yet, a naive composition of skills fails when a policy encounters a starting state never seen during its training. For successful skill chaining, prior approaches attempt to widen the policy's starting state distribution. However, these approaches require larger state distributions to be covered as more policies are sequenced, and thus are limited to short skill sequences. In this paper, we propose to chain multiple policies without excessively large initial state distributions by regularizing the terminal state distributions in an adversarial learning framework. We evaluate our approach on two complex long-horizon manipulation tasks of furniture assembly. Our results have shown that our method establishes the first model-free reinforcement learning algorithm to solve these tasks; whereas prior skill chaining approaches fail. The code and videos are available at https://clvrai.com/skill-chaining
研究动机与目标
- 解决长时程机器人操作中的技能链问题,其中由于终端状态与启动状态之间的分布偏移,简单的策略序列化方法会失效。
- 克服先前方法的局限性,即启动集合不断扩大,导致终止集合呈指数级增长,难以在长技能链中实现可扩展性。
- 开发一种方法,使终端状态分布保持较小且与下游策略的启动集合对齐,以实现高效、可扩展的技能链。
- 证明无需人工工程即可实现端到端、无模型的强化学习,用于复杂、接触丰富的操作任务(如 IKEA 家具组装)。
- 通过对抗性正则化终端状态,实现独立训练的子任务策略的鲁棒、顺序执行。
提出的方法
- 引入一种对抗学习框架,其中判别器用于区分下一个策略的启动集合与当前策略的终端状态。
- 将判别器的损失作为正则化信号,微调子任务策略,促使其中的终端状态聚集在下一个策略启动集合附近。
- 迭代优化每个策略的行为,使其最终状态位于下一个策略的策略网络定义域内,从而最小化分布偏移。
- 通过正则化策略输出,避免其扩散至状态空间中难以管理的区域,从而保持小而有界的终端状态分布。
- 在微调预训练子任务策略时应用此正则化,实现稳定且高效的链式结构,无需联合训练或大规模数据收集。
- 使用主成分分析(PCA)对物体状态配置进行分析,可视化并研究训练过程中终端状态分布的演化。
实验结果
研究问题
- RQ1终端状态正则化能否防止长时程技能链中启动集合需求的级联增长?
- RQ2无模型强化学习方法能否在无需人工任务分解或工程设计的情况下,成功解决复杂、接触丰富的操作任务(如 IKEA 家具组装)?
- RQ3与简单策略链或启动集合扩大方法相比,终端状态的对抗性正则化在多大程度上提升了顺序策略执行的成功率?
- RQ4在训练过程中,终端状态正则化在多大程度上限制了策略终止集合的大小和扩散范围?
- RQ5该方法能否在包含多个子任务和复杂动力学的多样化、高维操作任务中实现泛化?
主要发现
- 所提出的 T-STAR 方法在 chair_ingolf 家具组装任务中实现了 56% 的成功率,而策略序列基线方法为 0%,证明这是该任务首个成功的无模型解决方案。
- 在 table_lack 任务中,方法将成功率从基线的 59% 提升至 87%,显著提高了鲁棒性和可扩展性。
- 通过 PCA 可视化进行的定性分析证实,T-STAR 的终端状态分布保持有界且随时间缩小,而基线方法的分布显著扩散,表明存在不稳定性。
- T-STAR 中有界的终端状态分布减少了对后续策略所需覆盖范围的要求,从而实现了高效微调和多个技能间的稳定链式执行。
- 该方法成功地将多个闭环策略链式组合,用于复杂、高自由度的操作任务,在接触丰富的动力学环境下,而此前的技能链方法均以失败告终。
- 结果表明,终端状态正则化能有效缓解策略序列间的分布偏移,实现无需大而复杂启动集合的长时程任务执行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。