[论文解读] LeTS-Drive: Driving in a Crowd by Learning from Tree Search
LeTS-Drive 提出了一种混合框架,结合信念树搜索的模仿学习与在线 POMDP 规划,以实现在拥挤环境中的安全、高效且平滑的自动驾驶。通过从专家树搜索中学习策略和价值函数,并利用它们指导实时搜索,LeTS-Drive 相较于仅使用规划或仅使用学习的方法,将碰撞次数减少 50%,行程时间减少 30%。
Autonomous driving in a crowded environment, e.g., a busy traffic intersection, is an unsolved challenge for robotics. The robot vehicle must contend with a dynamic and partially observable environment, noisy sensors, and many agents. A principled approach is to formalize it as a Partially Observable Markov Decision Process (POMDP) and solve it through online belief-tree search. To handle a large crowd and achieve real-time performance in this very challenging setting, we propose LeTS-Drive, which integrates online POMDP planning and deep learning. It consists of two phases. In the offline phase, we learn a policy and the corresponding value function by imitating the belief tree search. In the online phase, the learned policy and value function guide the belief tree search. LeTS-Drive leverages the robustness of planning and the runtime efficiency of learning to enhance the performance of both. Experimental results in simulation show that LeTS-Drive outperforms either planning or imitation learning alone and develops sophisticated driving skills.
研究动机与目标
- 解决在存在大量交互行人的高度动态、部分可观察环境中自动驾驶的挑战。
- 克服纯模仿学习(例如泛化能力差)和纯规划(例如计算成本高)在拥挤场景中的局限性。
- 开发一种方法,结合规划的鲁棒性与学习的高效性,实现长期、安全且平滑的导航。
- 通过在多样化人群动态和地图布局上训练神经网络,实现对未见环境的泛化能力。
提出的方法
- 使用在线信念树搜索作为专家,生成模仿学习的演示数据。
- 训练一个深度策略网络以模仿专家的动作选择,同时训练一个价值网络以估计信念子树的值。
- 将学习到的策略和价值函数作为启发式信息,用于指导实时决策中的在线信念树搜索。
- 采用门控路径规划网络(GPPN)提供初始路径,再由第二重神经网络组件进行优化。
- 应用领域特定知识,设计在高维、部分可观察信念空间中高效运行的神经网络。
- 采用混合两阶段方法:离线模仿学习,随后使用学习到的模型进行在线引导搜索。
实验结果
研究问题
- RQ1从专家树搜索中学习到的策略和价值函数,是否能提升复杂人群导航中的实时性能?
- RQ2将学习与规划相结合,如何提升自动驾驶在行人环境中的安全性、效率和平滑性?
- RQ3所学习的模型在具有未见布局和行人动态的新环境中,其泛化能力达到何种程度?
- RQ4引导搜索机制是否能在保持或提升性能的同时,降低计算成本,相较于纯规划或纯学习方法?
主要发现
- 与 Decoupled-Action-POMDP 和 LeTS-Drive-Imitation 相比,LeTS-Drive 将行程时间减少约 30%,减速次数减少超过 50%。
- 在布局显著不同的新测试地图中,该方法实现了 99% 的成功率,优于仅使用模仿学习的方法。
- LeTS-Drive 对随机化行人位置和意图具有良好的泛化能力,在多样化场景中均保持高性能。
- 案例研究显示,车辆能够发展出复杂行为,如绕行行人群体、通过狭窄通道时与行人交互。
- 学习与规划的结合使车辆能够避免局部最优解,并生成更平滑、更高效的轨迹。
- 价值网络通过减少对无前景信念子树的探索,显著提升了搜索效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。