Skip to main content
QUICK REVIEW

[论文解读] Explicit-risk-aware Path Planning with Reward Maximization

Xuesu Xiao, Jan Dufek|arXiv (Cornell University)|Mar 7, 2019
Robotic Path Planning Algorithms参考文献 25被引用 11
一句话总结

本文提出了一种风险感知路径规划算法,显式地将运动风险建模为整个路径的函数,在非结构化或受限环境中平衡奖励最大化(例如最优传感器视角)与风险最小化。该方法提出一种两阶段算法——精确与近似——在系留飞行机器人上进行了验证,结果表明通过避免高风险、高奖励路径,转而选择更安全、性能优化的轨迹,显著提升了安全性与实际视觉辅助质量,同时最小化了路径的迂回程度和系绳接触。

ABSTRACT

This paper develops a path planner that minimizes risk (e.g. motion execution) while maximizing accumulated reward (e.g., quality of sensor viewpoint) motivated by visual assistance or tracking scenarios in unstructured or confined environments. In these scenarios, the robot should maintain the best viewpoint as it moves to the goal. However, in unstructured or confined environments, some paths may increase the risk of collision; therefore there is a tradeoff between risk and reward. Conventional state-dependent risk or probabilistic uncertainty modeling do not consider path-level risk or is difficult to acquire. This risk-reward planner explicitly represents risk as a function of motion plans, i.e., paths. Without manual assignment of the negative impact to the planner caused by risk, this planner takes in a pre-established viewpoint quality map and plans target location and path leading to it simultaneously, in order to maximize overall reward along the entire path while minimizing risk. Exact and approximate algorithms are presented, whose solution is further demonstrated on a physical tethered aerial vehicle. Other than the visual assistance problem, the proposed framework also provides a new planning paradigm to address minimum-risk planning under dynamical risk and absence of substructure optimality and to balance the trade-off between reward and risk.

研究动机与目标

  • 解决在非结构化或受限环境中,自主视觉辅助任务中平衡任务奖励与运动风险的挑战。
  • 开发一种路径规划算法,显式地将风险建模为不仅依赖于状态,还依赖于整个运动规划路径的函数,包括路径级特征如迂回程度和系绳接触。
  • 使机器人能够自主选择在累积奖励最大化的同时风险最小化的路径,避免高风险、高奖励的轨迹。
  • 通过系留飞行器在物理环境中的实验,验证规划算法的有效性,展示真实世界中的风险与奖励指标。

提出的方法

  • 提出一种新颖的显式风险表示方法,将风险建模为整个路径的函数,整合了如转弯次数和与障碍物接近程度等路径级特征。
  • 引入一种路径效用度量,定义为总累积奖励与总路径风险的比值,从而实现对奖励与风险权衡的直接优化。
  • 开发一种基于改进Dijkstra算法的精确算法,结合动态风险评估,适用于不具备子结构最优性的问题。
  • 提出一种两阶段近似算法,首先识别通往高奖励状态的最小风险路径,然后在其中选择效用(奖励/风险比)最高的路径。
  • 通过引入动力学和方向性组件,扩展了标准路径搜索方法,以处理依赖于路径历史和方向的成本。
  • 采用视点质量图作为输入,量化每个状态的奖励,从而实现奖励感知的路径选择。

实验结果

研究问题

  • RQ1在机器人路径规划中,如何将运动风险显式建模为整个路径的函数,而非仅依赖于状态?
  • RQ2在受限或非结构化环境中,如何有效构建奖励与风险平衡的公式,以应对自主视觉辅助任务?
  • RQ3一种以效用(奖励/风险比)为目标优化的路径规划算法,是否能在真实场景中优于传统仅最大化奖励或最小化风险的规划器?
  • RQ4路径级风险(如迂回程度和系绳接触)如何影响空中机器人在受限空间中的安全性与性能?

主要发现

  • 所提出的规划算法成功避免了高风险、高奖励路径(如需穿越障碍物间狭窄通道的路径),通过优先考虑效用而非原始奖励。
  • 在系留无人机上的物理实验表明,规划路径(绿色)与实际执行路径(蓝色)均与障碍物保持安全距离,且最小化了系绳接触,从而降低了路径风险。
  • 近似算法在最小风险候选路径中选择了效用最优的路径,实现了可见性质量与运动安全性的良好平衡。
  • 机器人实现了高质量的视觉辅助效果,表现为一致且高质量的视频图像快照(图7),同时保持了低状态风险与路径风险。
  • 该规划算法在三维空间中表现出鲁棒性,真实世界运动捕捉数据证实了其位置精度低于0.5mm,且路径执行稳定可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。