[论文解读] Conditional Driving from Natural Language Instructions
本文提出了一种分层的、以语言为依据的驾驶策略,能够解析自然语言指令,并通过图像观测和条件模仿学习控制自动驾驶汽车。该模型通过门控注意力机制和循环网络将高层语言推理与低层连续控制相结合,在多样化环境中实现稳健、安全的导航,即使在指令具有误导性或中断的情况下亦能保持性能,展示了在CARLA仿真中强大的泛化能力和实时交互性能。
Widespread adoption of self-driving cars will depend not only on their safety but largely on their ability to interact with human users. Just like human drivers, self-driving cars will be expected to understand and safely follow natural-language directions that suddenly alter the pre-planned route according to user's preference or in presence of ambiguities, particularly in locations with poor or outdated map coverage. To this end, we propose a language-grounded driving agent implementing a hierarchical policy using recurrent layers and gated attention. The hierarchical approach enables us to reason both in terms of high-level language instructions describing long time horizons and low-level, complex, continuous state/action spaces required for real-time control of a self-driving car. We train our policy with conditional imitation learning from realistic language data collected from human drivers and navigators. Through quantitative and interactive experiments within the CARLA framework, we show that our model can successfully interpret language instructions and follow them safely, even when generalizing to previously unseen environments. Code and video are available at https://sites.google.com/view/language-grounded-driving.
研究动机与目标
- 使自动驾驶汽车能够实时解析并执行自然语言指令,模拟人类驾驶员的交互行为。
- 即使在接收到误导性或模糊的语言指令(如在T字路口说'直行')时,也能确保安全行为。
- 泛化至未见过的环境,并在导航过程中处理动态的实时用户中断。
- 开发一种分层策略,能够在长时程语言指令下进行推理,同时通过连续状态/动作空间保持实时控制。
提出的方法
- 该模型采用分层架构,高层策略将语言指令映射为子任务,低层策略生成连续的转向/油门动作。
- 条件模仿学习使用从人类驾驶员和导航员处收集的真实世界语言数据来训练策略。
- 高层策略中使用门控注意力机制,基于语言和视觉特征联合条件化子任务预测。
- 低层策略基于子任务嵌入和图像观测进行条件化,实现在执行过程中的精细控制。
- 系统支持实时指令切换:新指令可中断正在进行的操纵动作,智能体在完成当前子任务后切换至新指令。
- 评估使用CARLA模拟器,结合真实分割地图和实时用户交互协议,以测试系统的鲁棒性。
实验结果
研究问题
- RQ1自动驾驶智能体是否能够在指令模糊或具有误导性的情况下,实时解析并遵循自然语言指令?
- RQ2视觉与语言输入的融合在错误指令下如何提升导航的鲁棒性与安全性?
- RQ3该分层结构在多大程度上实现了对未见环境和长时程语言指令的泛化能力?
- RQ4该模型在主动执行操纵过程中如何处理实时的、中断驱动的用户输入?
主要发现
- 完整模型(H_ikh)在使用图像和语言输入的情况下,对包含误导性指令的测试序列取得了94.6%的成功率。
- 在高层策略中引入图像观测显著提升了对误导性指令的性能,相比无图像基线模型,错误率明显降低。
- 即使在用户执行冲突或不及时的指令时,模型仍保持了高水平的安全性和任务完成度,展现出对实时中断的鲁棒性。
- 消融实验表明,基于门控注意力的低层策略结合子任务条件化,性能与固定层切换方法相当,表明其在应对未来复杂任务时具备灵活性。
- 该模型在新环境中表现出有效的泛化能力,在CARLA中不同地图布局和导航场景下均展现出优异的迁移性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。