[论文解读] CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation
本文提出 CoW(CLIP on Wheels),一种无需微调的零样本语言驱动导航框架,利用开放词汇 CLIP 模型实现对象定位。该研究提出了 Pasture 基准,用于评估在不常见、属性描述及隐藏对象上的导航表现,结果表明,简单的 CoW 基线在 RoboTHOR 上无需任何训练即可实现与最先进 ZSON 方法相当的导航效率,并将成功率提升 15.6 个百分点。
For robots to be generally useful, they must be able to find arbitrary objects described by people (i.e., be language-driven) even without expensive navigation training on in-domain data (i.e., perform zero-shot inference). We explore these capabilities in a unified setting: language-driven zero-shot object navigation (L-ZSON). Inspired by the recent success of open-vocabulary models for image classification, we investigate a straightforward framework, CLIP on Wheels (CoW), to adapt open-vocabulary models to this task without fine-tuning. To better evaluate L-ZSON, we introduce the Pasture benchmark, which considers finding uncommon objects, objects described by spatial and appearance attributes, and hidden objects described relative to visible objects. We conduct an in-depth empirical study by directly deploying 21 CoW baselines across Habitat, RoboTHOR, and Pasture. In total, we evaluate over 90k navigation episodes and find that (1) CoW baselines often struggle to leverage language descriptions, but are proficient at finding uncommon objects. (2) A simple CoW, with CLIP-based object localization and classical exploration -- and no additional training -- matches the navigation efficiency of a state-of-the-art ZSON method trained for 500M steps on Habitat MP3D data. This same CoW provides a 15.6 percentage point improvement in success over a state-of-the-art RoboTHOR ZSON model.
研究动机与目标
- 实现无需在目标环境或对象上进行特定任务微调的语言驱动零样本对象导航(L-ZSON)。
- 评估开放词汇模型(如 CLIP)在具有多样化、分布外语言描述的真实世界具身导航任务中的能力。
- 设计一个新基准 Pasture,用于测试在不常见、基于属性和隐藏对象上的导航——这些挑战未被现有基准涵盖。
- 在不进行微调的前提下,利用基于 CLIP 的感知与经典探索策略,建立强大的零样本基线。
- 实证评估开放词汇模型在利用自然语言进行导航时的局限性与优势。
提出的方法
- CoW 通过计算图像特征与文本描述之间的相似度得分,将 CLIP 适配于视觉-语言对齐任务,以定位目标对象。
- 采用两阶段策略:当语言描述产生高置信度定位时采用目标驱动规划,否则采用经典探索策略。
- 框架采用基于 CLIP 的视觉编码器,主干网络为 ViT-B/32,并应用后处理方法优化定位得分。
- 在不同提示策略、探索策略和主干架构下,评估了 21 种 CoW 变体。
- Pasture 基准包含 12 种物体类别,包含三种评估模式:不常见物体、空间/外观属性,以及隐藏物体。
- 评估在 Habitat、RoboTHOR 和 Pasture 上进行,总计超过 90,000 次导航任务。
实验结果
研究问题
- RQ1开放词汇模型(如 CLIP)是否可在无需任何微调的情况下有效用于零样本语言驱动对象导航?
- RQ2基于 CLIP 的模型在未见于训练阶段的不常见、基于属性和隐藏对象上的泛化能力如何?
- RQ3零样本 CoW 基线与有监督的最先进 ZSON 方法在导航效率与成功率上的性能差距有多大?
- RQ4在复杂、干扰物丰富的环境中,视觉-语言模型在多大程度上能有效利用语言描述?
- RQ5不同的提示工程、主干网络与后处理策略对 CoW 导航性能的影响如何?
主要发现
- 仅使用基于 CLIP 的定位与经典探索策略的简单 CoW 基线,在 Habitat MP3D 上的导航效率(SPL)与在 5 亿步训练后达到最先进水平的 ZSON 方法相当。
- 同一 CoW 基线在 RoboTHOR 上相较领先的 ZSON 模型,任务成功率提升 15.6 个百分点,展现出强大的零样本泛化能力。
- CoW 基线在不常见物体上表现优异(例如,在 Pasture 中对 'whiteboard' 的成功率达 63.3%),表明其对分布外类别具有鲁棒性。
- 在存在干扰物的情况下性能显著下降(例如,'mug' 在有干扰物时成功率为 20.0%,无干扰物时为 33.3%),表明其在利用基于属性的描述方面能力有限。
- 模型在使用带有属性的重映射类别时表现较差,干扰条件下的成功率更低,表明其在细粒度语言理解方面存在局限。
- CLIP-Patch 与 CLIP-Grad. 的对象定位失败率高于 OWL,表明提示工程与自适应方法对模型可靠性有显著影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。