[论文解读] From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data
本文提出条件行为变换器(C-BeT),一种基于Transformer的方法,无需奖励信号或在线交互,即可从未经整理的非专家人类操作数据中学习特定任务的机器人行为。通过结合动作离散化与未来目标条件化,C-BeT在先前方法基础上实现了平均45.7%的性能提升,并成功利用纯离线视觉与本体感觉数据训练出真实世界可用的策略。
While large-scale sequence modeling from offline data has led to impressive performance gains in natural language and image generation, directly translating such ideas to robotics has been challenging. One critical reason for this is that uncurated robot demonstration data, i.e. play data, collected from non-expert human demonstrators are often noisy, diverse, and distributionally multi-modal. This makes extracting useful, task-centric behaviors from such data a difficult generative modeling problem. In this work, we present Conditional Behavior Transformers (C-BeT), a method that combines the multi-modal generation ability of Behavior Transformer with future-conditioned goal specification. On a suite of simulated benchmark tasks, we find that C-BeT improves upon prior state-of-the-art work in learning from play data by an average of 45.7%. Further, we demonstrate for the first time that useful task-centric behaviors can be learned on a real-world robot purely from play data without any task labels or reward information. Robot videos are best viewed on our project website: https://play-to-policy.github.io
研究动机与目标
- 解决从非专家收集的未经整理、多模态且嘈杂的机器人操作数据中学习特定任务行为的挑战。
- 在无需任务特定奖励信号、标签或在线环境交互的情况下,实现在机器人领域中的条件行为生成。
- 将大规模生成模型在自然语言处理和视觉领域的成功经验,拓展至使用离线非结构化数据的机器人策略学习。
- 证明可直接从模拟环境和真实机器人中的原始人类示范中学习高性能、目标条件化的策略。
提出的方法
- C-BeT采用源自行为变换器(BeT)的Transformer架构,通过动作离散化建模连续动作,实现对高维控制输出序列的有效建模。
- 其策略生成基于未来目标状态进行条件化,类似于Play-GCBC,使模型能够预测导向目标结果的动作序列。
- 模型在未经整理的人类交互离线轨迹上进行端到端训练,无需奖励塑形或奖励函数。
- 它以视觉观测和本体感觉反馈作为输入,实现无需人工标注目标的视觉策略学习。
- 通过建模通向同一目标的多样化轨迹,该方法支持多模态行为生成,增强了对分布偏移的鲁棒性。
- C-BeT在大规模未经整理的游戏数据上以自监督方式训练,使其可扩展至真实世界部署。
实验结果
研究问题
- RQ1条件生成模型能否仅从纯离线、未经整理的人类游戏数据中学习到高效且特定任务的行为,而无需任何奖励信号?
- RQ2与基于奖励的条件化或行为克隆基线相比,未来条件化的行为生成在未见目标上的泛化能力与性能表现如何?
- RQ3基于Transformer且结合动作离散化的模型,在机器人操作任务中对多样化、多模态轨迹的泛化能力有多强?
- RQ4此类模型能否仅使用未经整理的人类示范中的视觉与本体感觉观测,在真实机器人任务中实现高性能表现?
主要发现
- 在从未经整理的游戏数据学习时,C-BeT在模拟基准测试中相较最先进方法平均提升45.7%的性能。
- 该模型仅使用4.5小时未经整理的人类游戏数据,成功在Franka机器人上学习到视觉策略,完成真实世界操作任务,且无需人工标注或奖励信号。
- 在多模态积木推动与厨房任务中,C-BeT能泛化至未见过的干扰物与目标配置,展现出对分布偏移的强鲁棒性。
- 在零样本目标泛化任务中,该模型在高维视觉环境中显著优于标准行为克隆与基于奖励的变换器方法。
- C-BeT表明,仅使用离线数据即可实现机器人领域中大规模、多模态行为生成,即使数据嘈杂且非专家操作亦可。
- 该方法实现了无需在线微调的真实世界策略部署,显著降低了数据与工程开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。