[论文解读] Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds
Steve-Eye 是一个大型多模态模型,通过将视觉编码器与预训练语言模型结合,使基于大语言模型的具身智能体在 Minecraft 等开放世界环境中具备视觉感知能力。该模型在通过 ChatGPT 收集的 850K 条指令遵循数据对上进行训练,实现了多模态感知、基础知识对齐和技能规划方面的最先进性能,在三个开放世界基准测试中表现优异,复杂任务的成功率最高达到 73%。
Recent studies have presented compelling evidence that large language models (LLMs) can equip embodied agents with the self-driven capability to interact with the world, which marks an initial step toward versatile robotics. However, these efforts tend to overlook the visual richness of open worlds, rendering the entire interactive process akin to "a blindfolded text-based game." Consequently, LLM-based agents frequently encounter challenges in intuitively comprehending their surroundings and producing responses that are easy to understand. In this paper, we propose Steve-Eye, an end-to-end trained large multimodal model designed to address this limitation. Steve-Eye integrates the LLM with a visual encoder which enables it to process visual-text inputs and generate multimodal feedback. In addition, we use a semi-automatic strategy to collect an extensive dataset comprising 850K open-world instruction pairs, empowering our model to encompass three essential functions for an agent: multimodal perception, foundational knowledge base, and skill prediction and planning. Lastly, we develop three open-world evaluation benchmarks, then carry out extensive experiments from a wide range of perspectives to validate our model's capability to strategically act and plan. Codes and datasets will be released.
研究动机与目标
- 为解决基于文本的大语言模型智能体在开放世界环境中缺乏视觉理解能力、导致响应不直观且上下文模糊的问题。
- 开发一种能够感知视觉与文本输入、基于现实世界上下文进行推理并生成可执行计划的多模态智能体。
- 构建一个大规模、高质量的指令数据集,以支持多模态感知、知识库整合和技能规划的端到端训练。
- 通过在 Minecraft 等开放式环境中的全面基准测试验证模型能力,展示其在战略规划与执行方面的能力。
提出的方法
- Steve-Eye 模型将视觉编码器(如基于 CLIP 的模型)与预训练大语言模型结合,处理多模态输入(图像 + 文本),并生成多模态输出。
- 采用半自动数据收集管道,利用 ChatGPT 生成 850K 条指令遵循数据对,包括视觉观察、文本上下文和专家推理的响应。
- 在该数据集上对模型进行端到端微调,以学习三项核心功能:多模态感知、基础知识对齐以及技能预测与规划。
- 在三个开放世界基准上进行评估:技能预测、技能规划和多模态感知,以 Minecraft 为主要测试平台。
- 通过将基于规则的游戏状态判断替换为学习到的技能预测,使模型支持自主运行,实现自主执行。
- 一种变体 Steve-Eye-auto 将外部游戏判断替换为模型自身的技能预测,实现完全自主的交互。
实验结果
研究问题
- RQ1大型多模态模型能否有效整合视觉与文本输入,从而提升智能体在开放世界环境中的环境理解能力?
- RQ2微调后的多模态模型在复杂、开放式的环境中,其技能规划与执行能力相较于纯文本大语言模型能提升多少?
- RQ3半自动收集的指令数据集在多模态感知、知识对齐和规划方面,对具身智能体的有效性如何?
- RQ4多模态智能体能否用学习到的、自我预测的技能执行替代基于规则的游戏状态评估?在复杂任务中性能下降程度如何?
主要发现
- 在 13b 参数版本的技能预测基准上,Steve-Eye 达到了 92.1% 的召回率和 84.2% 的准确率,显著优于基线模型。
- 在技能规划基准上,Steve-Eye 在 24 项复杂任务上的平均成功率达到 73%,在关键指标上超越 MineAgent(0.46)和 GPT Assistant(0.57)。
- Steve-Eye-auto 在最具挑战性的任务上实现了 70% 的成功率,表明其具备强大的自驱动能力。
- 尽管在长而复杂的任务中性能有所下降,但其表现仍显著优于基线模型,表明其在长序列推理中具备鲁棒性。
- 图 5 的定性分析显示,Steve-Eye 生成了连贯、分步的技能计划,且与任务目标一致,例如从木镐制作石斧。
- 850K 条指令数据集使模型能够学习到细微的视觉-文本推理、常识性知识和序列规划能力,这些是实现开放世界自主性的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。