[论文解读] Grounding Classical Task Planners via Vision-Language Models
本文提出TPVQA,一种基于视觉语言模型(VLM)的框架,通过将经典任务规划器与机器人感知相连接,利用VLM将动作先决条件(可操作性)和动作效果(失败)验证转化为视觉问答(VQA)任务。通过将VLM与符号规划相结合,TPVQA在复杂任务上实现了70%的任务完成率,显著优于仅依赖动作名称查询或缺乏先决条件检查的基线方法。
Classical planning systems have shown great advances in utilizing rule-based human knowledge to compute accurate plans for service robots, but they face challenges due to the strong assumptions of perfect perception and action executions. To tackle these challenges, one solution is to connect the symbolic states and actions generated by classical planners to the robot's sensory observations, thus closing the perception-action loop. This research proposes a visually-grounded planning framework, named TPVQA, which leverages Vision-Language Models (VLMs) to detect action failures and verify action affordances towards enabling successful plan execution. Results from quantitative experiments show that TPVQA surpasses competitive baselines from previous studies in task completion rate.
研究动机与目标
- 解决经典规划系统在真实环境中假设感知和动作执行完全准确的缺陷。
- 通过利用预训练的视觉语言模型,减少对计划监控的定制化工程依赖。
- 通过使用VLM验证动作先决条件并检测失败,实现鲁棒的计划执行,方法是利用自然语言查询。
- 通过将符号规划与视觉感知紧密耦合,提升长时序机器人任务的任务完成率。
提出的方法
- TPVQA将动作可操作性检查和失败检测建模为使用预训练视觉语言模型的视觉问答(VQA)任务。
- 在动作执行前,通过自然语言问题(如“可以拿起苹果吗?”)查询VLM以检查先决条件。
- 动作执行后,通过提问“动作是否成功?”或“盘子是否干净?”来验证效果,避免仅依赖动作名称的查询。
- 系统将符号规划器输出的先决条件和效果作为VLM的提示,实现对抽象动作的语义对齐。
- 若先决条件失败则触发重规划,若效果未达成则触发重执行,从而闭合感知-动作循环。
- 该框架在结合真实家庭图像与扩散增强图像的数据集上进行评估,并在真实机器人硬件上部署。
实验结果
研究问题
- RQ1预训练的视觉语言模型能否在经典规划背景下有效验证动作先决条件(可操作性)?
- RQ2与仅查询动作名称(如“洗盘子是否成功?”)相比,使用语义上对齐的问题(如“盘子是否干净?”)进行失败检测是否更具优势?
- RQ3与仅使用动作名称查询或无感知能力的基线方法相比,基于VLM的监控是否能提升长时序机器人任务的任务完成率?
- RQ4符号规划与视觉语言模型的集成如何减少机器人系统中对定制化感知模块的需求?
主要发现
- TPVQA在eat_apple任务上实现了70%的任务完成率,显著优于次佳基线方法(EffectVQA为53%),并超越PaLMEVQA和SuccessVQA。
- 针对世界状态变化的VQA策略(如“盘子是否干净?”)在动作效果监控中达到79%的准确率,优于仅基于动作名称的查询(如“洗盘子是否成功?”)的45%准确率。
- 同时考虑可操作性与失败检测的方法(TPVQA和PaLMEVQA)优于仅关注失败检测的方法(EffectVQA和SuccessVQA),凸显了先决条件检查的重要性。
- 仅使用符号规划而无感知能力的基线(TP)取得了63%的成功率,高于PaLMEVQA和SuccessVQA,表明VLM预测不准确可能降低整体性能。
- 当使用语义丰富的提问时,VLM在检测动作效果(79%)上的准确率高于对失败结果的检测(45%),表明效果监控比成功/失败检测更可靠。
- 真实机器人部署验证了TPVQA在真实世界物体重排任务中的可行性,证明其在仿真之外的实际适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。