[论文解读] STEVE-1: A Generative Model for Text-to-Behavior in Minecraft
该论文提出STEVE-1,一种生成式模型,仅使用60美元计算资源和2,000段指令标注轨迹,即可在Minecraft中实现文本到行为的控制。受unCLIP启发,该模型结合微调后的VPT策略与条件变分自编码器(CVAE)先验,从文本预测MineCLIP嵌入表示,从而在仅使用原始像素输入和低级控制指令的情况下,实现对13项早期游戏任务中12项的鲁棒零样本泛化。
Constructing AI models that respond to text instructions is challenging, especially for sequential decision-making tasks. This work introduces a methodology, inspired by unCLIP, for instruction-tuning generative models of behavior without relying on a large dataset of instruction-labeled trajectories. Using this methodology, we create an instruction-tuned Video Pretraining (VPT) model called STEVE-1, which can follow short-horizon open-ended text and visual instructions in Minecraft. STEVE-1 is trained in two steps: adapting the pretrained VPT model to follow commands in MineCLIP's latent space, then training a prior to predict latent codes from text. This allows us to finetune VPT through self-supervised behavioral cloning and hindsight relabeling, reducing the need for costly human text annotations, and all for only $60 of compute. By leveraging pretrained models like VPT and MineCLIP and employing best practices from text-conditioned image generation, STEVE-1 sets a new bar for open-ended instruction-following in Minecraft with low-level controls (mouse and keyboard) and raw pixel inputs, far outperforming previous baselines and robustly completing 12 of 13 tasks in our early-game evaluation suite. We provide experimental evidence highlighting key factors for downstream performance, including pretraining, classifier-free guidance, and data scaling. All resources, including our model weights, training scripts, and evaluation tools are made available for further research.
研究动机与目标
- 在不依赖大规模昂贵指令标注轨迹数据集的前提下,实现在Minecraft等序列决策环境中的指令遵循能力。
- 将预训练生成模型(VPT)适配于遵循开放性、短时程的文本与视觉指令,方法为使用自监督行为克隆与事后重标注。
- 探究将unCLIP风格的策略与先验解耦机制,结合无分类器指导,是否能提升文本到行为生成的性能。
- 证明在复杂、基于像素的环境与低级控制条件下,低成本、高精度的指令微调是可行的。
- 公开模型权重、训练脚本与评估工具,以加速开放性、可控智能体的研究。
提出的方法
- 利用预训练的MineCLIP嵌入作为目标监督,微调VPT模型以根据视觉目标进行行为控制,通过自监督行为克隆与事后重标注避免昂贵的文本标注。
- 训练一个条件变分自编码器(CVAE)先验,将文本提示映射到MineCLIP潜在嵌入表示,从而实现文本条件化的行为生成。
- 在推理阶段应用unCLIP风格方法,结合无分类器指导,通过使模型同时关注条件输出与无条件输出,提升生成质量与鲁棒性。
- 采用两阶段训练流程:第一阶段,将VPT适配于在MineCLIP空间中达成视觉目标;第二阶段,使用文本到视觉嵌入对训练CVAE先验。
- 利用VPT(70,000小时游戏数据预训练)与MineCLIP(图文对齐)的预训练优势,降低对数据与计算资源的需求。
- 采用提示工程与提示链技术,将性能扩展至长时程任务,如合成与建造。
实验结果
研究问题
- RQ1能否仅使用极少人工标注的指令数据,对生成模型进行指令微调,以实现在Minecraft中的文本到行为控制?
- RQ2受unCLIP启发的策略与先验解耦机制,是否能提升序列决策任务中的零样本泛化能力?
- RQ3预训练、无分类器指导与数据规模扩展,如何影响文本到行为生成的下游性能?
- RQ4自监督行为克隆结合事后重标注,能否有效替代昂贵的指令标注轨迹?
- RQ5提示工程与提示链在多大程度上可将性能扩展至长时程任务?
主要发现
- STEVE-1仅使用60美元计算资源与2,000段指令标注片段,成功完成早期游戏评估套件中13项任务中的12项。
- 该模型对未见过的提示变体具有鲁棒泛化能力,包括人工设计的提示如“破坏高草,破坏草,收集种子”。
- 无分类器指导显著提升了生成质量与成功率,尤其在复杂或模糊指令中表现突出。
- VPT预训练与MineCLIP视觉嵌入的结合,使模型在无需额外微调的情况下,实现对新任务的强零样本迁移能力。
- 提示链技术使模型能够解决长时程任务,如制作木镐与建造高塔,而这些任务在简单提示下通常无法完成。
- 该方法通过使用视觉嵌入的自监督事后重标注,显著降低了对昂贵人工标注指令轨迹的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。