[论文解读] Touchdown: Natural Language Navigation and Spatial Reasoning in Visual Street Environments
本文提出了Touchdown,一个基于Google街景图像的新型基准,用于真实城市环境中的自然语言导航与空间推理。该研究设计了两项任务——遵循导航指令与利用空间描述定位隐藏物体,证明了真实世界视觉输入相较于模拟环境或静态图像任务,对空间与语言推理能力的要求显著更高。最佳模型在导航任务上的成功率为10.7%,远低于人类水平(92%),凸显了该数据集的挑战性。
We study the problem of jointly reasoning about language and vision through a navigation and spatial reasoning task. We introduce the Touchdown task and dataset, where an agent must first follow navigation instructions in a real-life visual urban environment, and then identify a location described in natural language to find a hidden object at the goal position. The data contains 9,326 examples of English instructions and spatial descriptions paired with demonstrations. Empirical analysis shows the data presents an open challenge to existing methods, and qualitative linguistic analysis shows that the data displays richer use of spatial reasoning compared to related resources.
研究动机与目标
- 开发一个面向真实视觉环境的视觉-语言推理基准,突破模拟环境或静态图像设置的局限。
- 研究在复杂动态城市场景中,同时遵循自然语言导航指令与解析空间描述的联合挑战。
- 构建一种可扩展、基于语言的自然数据采集流程,生成自然且有效的导航指令与空间描述。
- 评估现有模型在真实世界视觉导航与空间推理任务上的局限性。
- 发布一个大规模数据集,包含9,326个导航示例与27,575个空间描述解析任务,以供未来研究使用。
提出的方法
- Touchdown任务结合了真实街景全景图中的导航与空间描述解析,以定位隐藏物体(一只泰迪熊)。
- 数据采集采用目标驱动流程,工作人员编写并执行导航指令以隐藏Touchdown,确保语言表达自然且有效。
- 导航任务通过监督学习在示范动作上进行训练,使用RConcat与GA等模型进行评估。
- 空间描述解析被建模为图像特征重建问题,采用语言条件化的UNet变体(LingUNet),其性能优于基线模型。
- 数据集包含29,641张全景图,覆盖多样化的城市环境,完整标注了导航路径与Touchdown位置。
- 通过结合表现最佳的导航模型与SDR模型,构建端到端任务完成的评估流水线。

实验结果
研究问题
- RQ1与模拟环境或静态图像设置相比,真实城市环境中视觉输入如何影响语言定位与空间推理的复杂性?
- RQ2现有视觉-语言模型在真实世界导航与空间描述解析任务上的泛化能力如何?
- RQ3在真实人类于城市环境中导航时收集的自然语言指令与描述中,涌现出哪些语言与空间推理模式?
- RQ4语言条件化的UNet架构能否有效从真实街景图像的空间描述中重建隐藏物体的位置?
- RQ5最先进模型在Touchdown任务上的表现与人类在任务成功率与空间准确性方面的表现相比如何?
主要发现
- Touchdown数据集包含9,326个导航示例与27,575个空间描述解析(SDR)任务,数据来源于真实街景环境。
- 人类在完整任务上的准确率为92%,而最佳模型在80px阈值下的准确率仅为4.5%,表明存在显著的泛化差距。
- RConcat模型在导航任务中取得10.7%的成功率,优于GA模型(5.5%)与所有非学习基线模型。
- 用于SDR的LingUNet模型显著优于强基线模型,证明了语言条件化图像特征重建的有效性。
- 语言学分析显示,95%的示例需要解析多个物体与智能体位置之间的空间关系,平均每例包含5.3条指令与10.7个唯一实体。
- 该数据集对现有方法构成重大开放挑战,其复杂的空间推理需求远超R2R或Talk the Walk等相关数据集中的水平。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。