Skip to main content
QUICK REVIEW

[论文解读] LeTS-Drive: Driving in a Crowd by Learning from Tree Search

Panpan Cai, Yuanfu Luo|arXiv (Cornell University)|May 29, 2019
Data Stream Mining Techniques被引用 8
一句话总结

LeTS-Drive 提出了一种混合框架,结合信念树搜索的模仿学习与在线 POMDP 规划,以实现在拥挤环境中的安全、高效且平滑的自动驾驶。通过从专家树搜索中学习策略和价值函数,并利用它们指导实时搜索,LeTS-Drive 相较于仅使用规划或仅使用学习的方法,将碰撞次数减少 50%,行程时间减少 30%。

ABSTRACT

Autonomous driving in a crowded environment, e.g., a busy traffic intersection, is an unsolved challenge for robotics. The robot vehicle must contend with a dynamic and partially observable environment, noisy sensors, and many agents. A principled approach is to formalize it as a Partially Observable Markov Decision Process (POMDP) and solve it through online belief-tree search. To handle a large crowd and achieve real-time performance in this very challenging setting, we propose LeTS-Drive, which integrates online POMDP planning and deep learning. It consists of two phases. In the offline phase, we learn a policy and the corresponding value function by imitating the belief tree search. In the online phase, the learned policy and value function guide the belief tree search. LeTS-Drive leverages the robustness of planning and the runtime efficiency of learning to enhance the performance of both. Experimental results in simulation show that LeTS-Drive outperforms either planning or imitation learning alone and develops sophisticated driving skills.

研究动机与目标

  • 解决在存在大量交互行人的高度动态、部分可观察环境中自动驾驶的挑战。
  • 克服纯模仿学习(例如泛化能力差)和纯规划(例如计算成本高)在拥挤场景中的局限性。
  • 开发一种方法,结合规划的鲁棒性与学习的高效性,实现长期、安全且平滑的导航。
  • 通过在多样化人群动态和地图布局上训练神经网络,实现对未见环境的泛化能力。

提出的方法

  • 使用在线信念树搜索作为专家,生成模仿学习的演示数据。
  • 训练一个深度策略网络以模仿专家的动作选择,同时训练一个价值网络以估计信念子树的值。
  • 将学习到的策略和价值函数作为启发式信息,用于指导实时决策中的在线信念树搜索。
  • 采用门控路径规划网络(GPPN)提供初始路径,再由第二重神经网络组件进行优化。
  • 应用领域特定知识,设计在高维、部分可观察信念空间中高效运行的神经网络。
  • 采用混合两阶段方法:离线模仿学习,随后使用学习到的模型进行在线引导搜索。

实验结果

研究问题

  • RQ1从专家树搜索中学习到的策略和价值函数,是否能提升复杂人群导航中的实时性能?
  • RQ2将学习与规划相结合,如何提升自动驾驶在行人环境中的安全性、效率和平滑性?
  • RQ3所学习的模型在具有未见布局和行人动态的新环境中,其泛化能力达到何种程度?
  • RQ4引导搜索机制是否能在保持或提升性能的同时,降低计算成本,相较于纯规划或纯学习方法?

主要发现

  • 与 Decoupled-Action-POMDP 和 LeTS-Drive-Imitation 相比,LeTS-Drive 将行程时间减少约 30%,减速次数减少超过 50%。
  • 在布局显著不同的新测试地图中,该方法实现了 99% 的成功率,优于仅使用模仿学习的方法。
  • LeTS-Drive 对随机化行人位置和意图具有良好的泛化能力,在多样化场景中均保持高性能。
  • 案例研究显示,车辆能够发展出复杂行为,如绕行行人群体、通过狭窄通道时与行人交互。
  • 学习与规划的结合使车辆能够避免局部最优解,并生成更平滑、更高效的轨迹。
  • 价值网络通过减少对无前景信念子树的探索,显著提升了搜索效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。