[论文解读] Transformers are Adaptable Task Planners
该论文提出了一种基于Transformer的Task Planner(TTP),通过使用以物体为中心、时间敏感且姿态感知的表征方式,从演示中学习高层级操作策略。TTP仅需一次演示即可泛化至未见过的用户偏好,在仿真环境与真实世界Franka Panda机械臂之间实现零样本迁移,完成餐具重新排列任务。
Every home is different, and every person likes things done in their particular way. Therefore, home robots of the future need to both reason about the sequential nature of day-to-day tasks and generalize to user's preferences. To this end, we propose a Transformer Task Planner(TTP) that learns high-level actions from demonstrations by leveraging object attribute-based representations. TTP can be pre-trained on multiple preferences and shows generalization to unseen preferences using a single demonstration as a prompt in a simulated dishwasher loading task. Further, we demonstrate real-world dish rearrangement using TTP with a Franka Panda robotic arm, prompted using a single human demonstration.
研究动机与目标
- 解决在动态环境和用户特定偏好下学习可适应、长时程任务计划的挑战。
- 通过用端到端的演示学习替代手工编码的约束,克服符号化任务规划的局限性。
- 仅使用一次人类演示作为提示,实现对新偏好的零样本泛化。
- 弥合复杂操作任务(如洗碗机装载和抽屉整理)的仿真到现实的差距。
提出的方法
- 将每个物体表示为一个7维向量,结合3D姿态、类别和时间步,实现空间-时间建模。
- 采用Transformer架构,并引入时间、物体姿态和类别的专用嵌入,以建模动作序列中的长程依赖关系。
- 使用每种偏好80次演示,对TTP在7种不同用户偏好上进行预训练,以学习通用的时间表征。
- 应用基于提示的推理:一次人类演示作为条件,使模型在测试时推断出新的偏好。
- 为每类物体使用一组离散的预编译放置姿态,密集覆盖洗碗机中的可行位置。
- 利用先前状态的上下文窗口处理部分可观测性(如关闭的货架),在不确定性下提升决策能力。
实验结果
研究问题
- RQ1基于Transformer的架构能否在无符号任务描述的情况下,从长时程演示中隐式学习任务结构与偏好?
- RQ2通过偏好条件化的预训练,能否仅用一次演示就实现对未见用户偏好的零样本泛化?
- RQ3该模型在具有可变物体数量和部分可观测状态的动态环境中,其有效性如何?
- RQ4姿态与类别嵌入的设计在多大程度上影响真实世界迁移中的性能表现?
- RQ5模型能否仅用一次真实世界演示,就实现从仿真到真实世界操作任务(如餐具重新排列)的泛化?
主要发现
- 在所有上下文窗口大小下,TTP在验证集上的类别级预测准确率均超过90%,表明其对部分可观测性的鲁棒性。
- 姿态嵌入的傅里叶变换优于原始7维姿态向量,表明其能更好地编码空间与时间的细微差别。
- 更大的上下文窗口可加速初始学习,但不会提升最终性能,暗示数据集在短上下文下已基本可观测。
- TTP在未见偏好和动态场景中均表现出色,优于竞争性基线模型,在仿真与真实世界评估中均表现更优。
- 在仅使用一次人类演示作为提示的情况下,TTP成功实现了对真实世界Franka Panda机械臂的零样本迁移,完成将餐具组织至两个抽屉的任务。
- 模型在可变物体数量和未见配置下表现出强大的泛化能力,证实其适应性超越了训练分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。