[论文解读] Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics
本文提出关键点动作标记(Keypoint Action Tokens, KAT),一种使现成的文本预训练Transformer模型(如GPT-4 Turbo)无需在机器人数据上微调即可实现少样本上下文模仿学习的方法。该方法通过将视觉观测和动作轨迹转换为基于关键点的文本标记序列,使大型语言模型仅通过模式学习即可泛化至视觉-动作序列到序列的任务。即使未在机器人数据上进行微调,KAT在真实世界任务中仅使用10次示范即达到最先进性能,证明了大型语言模型可通过模式学习泛化至视觉-动作序列到序列任务。
We show that off-the-shelf text-based Transformers, with no additional training, can perform few-shot in-context visual imitation learning, mapping visual observations to action sequences that emulate the demonstrator's behaviour. We achieve this by transforming visual observations (inputs) and trajectories of actions (outputs) into sequences of tokens that a text-pretrained Transformer (GPT-4 Turbo) can ingest and generate, via a framework we call Keypoint Action Tokens (KAT). Despite being trained only on language, we show that these Transformers excel at translating tokenised visual keypoint observations into action trajectories, performing on par or better than state-of-the-art imitation learning (diffusion policies) in the low-data regime on a suite of real-world, everyday tasks. Rather than operating in the language domain as is typical, KAT leverages text-based Transformers to operate in the vision and action domains to learn general patterns in demonstration data for highly efficient imitation learning, indicating promising new avenues for repurposing natural language models for embodied tasks. Videos are available at https://www.robot-learning.uk/keypoint-action-tokens.
研究动机与目标
- 在无需在机器人数据上进行任何微调的情况下,利用预训练语言模型实现机器人领域的少样本模仿学习。
- 通过利用大型文本型Transformer模型的涌现式少样本模式识别能力,应对机器人学习中的数据稀缺挑战。
- 开发一种通用框架,将视觉观测和动作序列映射为与文本兼容的标记格式,以支持序列到序列学习。
- 评估现成的大语言模型是否能在低数据场景下表现得与或优于专用的模仿学习模型(如扩散策略)。
- 研究KAT在多样化真实世界任务中的可扩展性和性能表现,包括空间泛化、新物体泛化以及6-DoF轨迹控制。
提出的方法
- 关键点动作标记(KAT)将视觉观测和动作轨迹表示为关键点坐标的序列,随后转换为自然语言标记(例如,'左手位于(x,y,z)'),输入至基于文本的Transformer模型。
- 该方法使用预训练的视觉Transformer从每帧观测中提取固定数量的关键点(K),将空间和时间结构编码为描述性标记序列。
- 将示范数据和当前观测拼接为提示(prompt),其中输入序列包含来自专家示范的关键点标记和动作标记。
- 基于文本的预训练Transformer(如GPT-4 Turbo)通过生成下一个动作标记序列来执行上下文学习,这些标记随后被解码为机器人控制指令。
- 该框架完全在推理模式下运行,无需在机器人数据上进行微调或额外训练。
- 该方法支持长上下文输入,可在一个提示中处理多个示范和复杂轨迹。

实验结果
研究问题
- RQ1未经微调的现成文本预训练Transformer能否在机器人领域实现少样本上下文模仿学习?
- RQ2在仅提供10次示范的情况下,KAT在未见物体、空间构型和多模态行为上的泛化能力如何?
- RQ3即使未进行任何机器人特定训练,KAT的性能是否会随着大语言模型新版本的推出而提升?
- RQ4在低数据场景下,KAT能否实现与或优于最先进扩散策略的性能?
- RQ5当扩展至更长的示范序列或实时在线控制时,KAT存在哪些局限性?
主要发现
- KAT在真实世界机器人任务(如Align T、Wipe Plate、Sweep和Bottle Upright)中仅使用10次示范且无需微调即达到最先进性能。
- GPT-4 Turbo在少样本模仿学习中优于GPT-3 Turbo和GPT-2,表明新一代大语言模型对视觉-动作序列的泛化能力更强。
- 在低数据场景下,该方法性能与或优于扩散策略,表明基于大语言模型的上下文学习在模仿学习中具有高度效率。
- 随着大语言模型上下文窗口的增大,性能提升,表明更长的输入序列可增强模式识别与轨迹生成能力。
- 该框架可在示范后立即部署所学技能,因为无需重新训练模型。
- KAT在新物体和空间构型上表现出强泛化能力,表明其在真实世界环境中对分布偏移具有鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。