Skip to main content
QUICK REVIEW

[论文解读] POMP: Pomcp-based Online Motion Planning for active visual search in indoor environments

Yiming Wang, Francesco Giuliari|arXiv (Cornell University)|Sep 17, 2020
Video Analysis and Summarization参考文献 29被引用 6
一句话总结

POMP 提出了一种基于 POMCP 的在线运动规划框架,用于在室内环境中进行主动视觉搜索,利用实时 RGB-D 观测和已知的平面图,引导智能体在无需预训练的情况下找到目标物体。该方法在 AVD 基准测试中实现了 76% 的成功率,平均路径长度为 17.1,优于当前最先进方法的成功率,且无需标注数据或模型微调。

ABSTRACT

In this paper we focus on the problem of learning an optimal policy for Active Visual Search (AVS) of objects in known indoor environments with an online setup. Our POMP method uses as input the current pose of an agent (e.g. a robot) and a RGB-D frame. The task is to plan the next move that brings the agent closer to the target object. We model this problem as a Partially Observable Markov Decision Process solved by a Monte-Carlo planning approach. This allows us to make decisions on the next moves by iterating over the known scenario at hand, exploring the environment and searching for the object at the same time. Differently from the current state of the art in Reinforcement Learning, POMP does not require extensive and expensive (in time and computation) labelled data so being very agile in solving AVS in small and medium real scenarios. We only require the information of the floormap of the environment, an information usually available or that can be easily extracted from an a priori single exploration run. We validate our method on the publicly available AVD benchmark, achieving an average success rate of 0.76 with an average path length of 17.1, performing close to the state of the art but without any training needed. Additionally, we show experimentally the robustness of our method when the quality of the object detection goes from ideal to faulty.

研究动机与目标

  • 解决因遮挡、模糊和部分视图导致目标检测不可靠的室内环境中主动视觉搜索(AVS)挑战。
  • 开发一种在线学习的运动规划策略,适应环境变化或传感器质量波动,无需预训练模型。
  • 通过利用已知的环境地图,减少对昂贵、耗时且计算量大的强化学习数据集的依赖。
  • 提高对噪声目标检测器的鲁棒性——同时处理漏检和误检——同时保持高成功率。
  • 通过轻量级、可泛化的规划方式,实现小到中型室内场景的实时部署,且设置简单。

提出的方法

  • POMP 将 AVS 问题建模为部分可观测马尔可夫决策过程(POMDP),并使用 POMCP 算法通过蒙特卡洛树搜索(MCTS)求解。
  • 在每个时间步,利用智能体的位姿和当前的 RGB-D 图像检测候选目标;深度数据将检测结果投影到 2D 平面图中,用于空间推理。
  • 粒子滤波器维护目标位置的信念状态,根据检测结果和传感器视场约束条件进行更新。
  • POMCP 规划器选择能最大化期望奖励的动作(移动),奖励定义为靠近目标物体以及提升可见性的程度。
  • 检测后,路径重规划模块使用 Dijkstra 算法计算最短路径,并采用鲁棒的对接策略以保持目标的正前方对齐。
  • 该方法显式建模环境几何结构(如墙壁、障碍物)和可见性,避免通过数据隐式编码此类知识。

实验结果

研究问题

  • RQ1基于 POMCP 的在线、模型驱动规划是否能在无需大规模标注数据集预训练的情况下,实现具有竞争力的 AVS 性能?
  • RQ2POMP 框架在目标检测质量下降(如漏检和误检)时的鲁棒性如何?
  • RQ3与端到端学习方法相比,使用已知平面图在多大程度上提升了规划效率和成功率?
  • RQ4与离线训练相比,在线策略学习是否能实现对环境变化或新传感器模态的更快适应?
  • RQ5在杂乱和遮挡严重的复杂室内场景中,POMP 是否能保持高性能,同时最小化路径长度?

主要发现

  • POMP 在 AVD 基准测试中实现了 76% 的平均成功率,平均路径长度为 17.1,尽管未进行预训练,其成功率仍优于当前最先进方法。
  • 在理想检测器条件下,POMP 的成功率达到 0.76(0.26),平均路径长度为 17.1,性能与 EAT 接近或更优,且无需任何模型微调。
  • 该方法对漏检具有较强鲁棒性,仅在 60% 的真实标注被移除后成功率才出现明显下降。
  • 误检对成功率的负面影响更强,但平均路径长度保持稳定,因为 APL 仅在成功路径上计算。
  • 在对接阶段的路径重规划使成功率平均提升 3.5%,尽管路径长度略有增加,证明了其在最终接近阶段的有效性。
  • 系统在 6 核 CPU 上每步运行时间为 0.07 秒,表明其在真实室内场景中具备实时部署可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。