[论文解读] VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View
VELMA 是一种用于街景环境中视觉-语言导航的新型基于大语言模型(LLM)的智能体,它利用口头化的视觉观测结果和轨迹历史作为动作预测的上下文。通过从指令中提取地标,并使用 CLIP 验证其可见性,VELMA 在两个数据集上微调后实现了 SOTA 性能,任务完成率相对提升了 25%。
Incremental decision making in real-world environments is one of the most challenging tasks in embodied artificial intelligence. One particularly demanding scenario is Vision and Language Navigation~(VLN) which requires visual and natural language understanding as well as spatial and temporal reasoning capabilities. The embodied agent needs to ground its understanding of navigation instructions in observations of a real-world environment like Street View. Despite the impressive results of LLMs in other research areas, it is an ongoing problem of how to best connect them with an interactive visual environment. In this work, we propose VELMA, an embodied LLM agent that uses a verbalization of the trajectory and of visual environment observations as contextual prompt for the next action. Visual information is verbalized by a pipeline that extracts landmarks from the human written navigation instructions and uses CLIP to determine their visibility in the current panorama view. We show that VELMA is able to successfully follow navigation instructions in Street View with only two in-context examples. We further finetune the LLM agent on a few thousand examples and achieve 25%-30% relative improvement in task completion over the previous state-of-the-art for two datasets.
研究动机与目标
- 使大语言模型(LLMs)能够在真实世界、大规模的城市环境(如街景)中执行渐进式决策。
- 解决在动态真实视觉观测中定位自然语言导航指令的挑战。
- 通过利用口头化的环境状态和轨迹上下文,提升视觉-语言导航(VLN)中的 few-shot 和微调性能。
- 解决 Touchdown 环境中的局限性,例如在交叉路口处的动作对齐错误以及缺乏直观动作(如 TURN_AROUND)。
- 证明基于口头化的 LLM 实体化方法可在无需端到端训练的情况下,在复杂真实 VLN 任务中实现优异性能。
提出的方法
- VELMA 使用基于口头化的提示策略,将包含任务描述、导航指令、过往动作和口头化视觉观测的自然语言序列作为 LLM 的输入。
- 视觉观测通过一个流水线进行口头化处理:从人工编写的指令中提取地标,并利用 CLIP 计算地标与当前全景视图之间的相似度得分,以判断其可见性。
- 智能体通过在每一步基于完整上下文提示预测下一步动作(例如:FORWARD、TURN_LEFT、TURN_AROUND)来实现渐进式决策。
- 提出一种新型训练方法——基于响应的学习(Response-Based Learning, RBL),结合教师强制(teacher forcing)与学生强制(student forcing),混合比例 λ=0.5,以提升策略学习与泛化能力。
- 当智能体未能到达目标时,通过一个“理想化”模型计算最优反事实动作序列,以提供纠正性监督信号。
- 方法还包括环境修改:修复交叉路口处的对齐错误,并增加 TURN_AROUND 动作,以提升导航的真实感与性能。
实验结果
研究问题
- RQ1能否通过使用口头化上下文而非端到端训练,有效实现 LLM 在真实世界、大规模城市环境(如街景)中的实体化?
- RQ2通过地标检测与基于 CLIP 的可见性评分实现的视觉观测口头化,在提升基于 LLM 的导航性能方面有多有效?
- RQ3仅使用两个 few-shot 示例的 few-shot 上下文学习是否能在城市 VLN 中实现有竞争力的性能?微调如何进一步提升性能?
- RQ4在环境层面进行的修改(如增加 TURN_AROUND 动作和修复交叉路口问题)对智能体性能与训练稳定性有何影响?
- RQ5视觉编码器的选择(CLIP 与 OpenCLIP)如何影响地标检测与整体任务成功率?
主要发现
- VELMA 在 Map2seq 数据集上实现了 23% 的任务完成率,在 Touchdown 上为 10%,表明仅使用两个 few-shot 示例即可实现强大的 few-shot 泛化能力。
- 在完整训练集上微调后,VELMA 在 Touchdown 上达到 26% 的任务完成率,在 Map2seq 上达到 47%,相较于此前 SOTA 水平相对提升了 25%。
- 使用 OpenCLIP 进行地标评分的表现优于原始 CLIP 模型,表明改进的视觉编码器可直接提升智能体性能。
- 从提示中移除地标信息会显著降低性能,尤其在 Touchdown 上,证实了视觉定位在上下文中的重要性。
- 在环境中增加 TURN_AROUND 动作并修正交叉路口对齐问题,显著提升了智能体处理复杂停止条件的能力。
- 智能体通过在不确定地标处继续前行并在可见时折返,成功处理了模糊的停止指令(如“在 Y 前停止”或“在 X 停止,但不要越过 Y”),展示了有效的空间推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。