[论文解读] Action-Based Representation Learning for Autonomous Driving
本文提出了一种面向自动驾驶的基于动作的表征学习框架,通过利用逆动力学、前向动力学和行为克隆,从专家示范中学习解耦的视觉表征。通过在专家数据上预训练表征模型,并微调用于可操作性预测,该方法在驾驶基准测试中表现出色,特别是在停车等待红灯方面,显著优于端到端模仿学习。
Human drivers produce a vast amount of data which could, in principle, be used to improve autonomous driving systems. Unfortunately, seemingly straightforward approaches for creating end-to-end driving models that map sensor data directly into driving actions are problematic in terms of interpretability, and typically have significant difficulty dealing with spurious correlations. Alternatively, we propose to use this kind of action-based driving data for learning representations. Our experiments show that an affordance-based driving model pre-trained with this approach can leverage a relatively small amount of weakly annotated imagery and outperform pure end-to-end driving models, while being more interpretable. Further, we demonstrate how this strategy outperforms previous methods based on learning inverse dynamics models as well as other methods based on heavy human supervision (ImageNet).
研究动机与目标
- 通过利用来自专家示范的动作监督,改进自动驾驶的视觉表征学习。
- 探究在专家数据上预训练是否相比端到端模仿学习能提升下游可操作性预测和驾驶性能。
- 使用CARLA 0.9.6构建一个增强版行人和车辆动力学的稳健基准,用于评估驾驶策略。
- 评估不同自监督学习目标(逆模型、前向模型和行为克隆)在驾驶表征学习中的有效性。
- 证明基于可操作性的控制结合预训练表征能显著提升驾驶性能,尤其在停车等待红灯等关键安全场景中。
提出的方法
- 该方法使用ResNet-34编码器处理图像观测、速度和高层命令,将特征拼接后通过共享和任务特定的头部进行处理。
- 采用三种自监督学习目标:逆动力学(从状态转移中预测动作)、前向动力学(从动作中预测未来状态)和行为克隆(从状态中预测动作)。
- 训练一个独立的可操作性预测网络 $ g_{ heta} $,用于预测二值可操作性(行人、车辆、红灯)和相对方向盘转角。
- 基于PID的控制器使用预测的可操作性生成方向盘、油门和刹车指令,当检测到危险时触发刹车。
- 通过线性探测进行微调,并在CARLA 0.9.6中修改的NoCrash基准上进行评估,其中行人和车辆动力学已更新。
- 该框架采用预训练策略,即对行为克隆编码器进行微调以用于可操作性预测,从而在泛化能力上优于端到端训练。
实验结果
研究问题
- RQ1在专家示范上预训练表征模型是否相比端到端模仿学习能提升可操作性预测和下游驾驶性能?
- RQ2在学习自动驾驶有用视觉表征方面,不同自监督学习目标(逆模型、前向模型和行为克隆)的表现如何比较?
- RQ3结合预训练表征的基于可操作性的控制是否能在关键安全场景(如红灯停车)中实现更优性能?
- RQ4具有增强行人和车辆动力学的更新版CARLA 0.9.6基准如何影响驾驶策略的评估?
- RQ5使用专家示范进行预训练与使用随机策略数据相比,对驾驶策略的泛化能力和鲁棒性有何影响?
主要发现
- 行为克隆预训练显著优于端到端行为克隆,在常规NoCrash基准上达到91%的成功率,在密集场景中达到68%,而端到端训练分别为47%和20%。
- 逆模型在预测导航操作方面表现最佳,左转的平均绝对误差(MAE)为0.17°,而行为克隆为3.76°,使用专家数据的逆模型为2.03°。
- 通过逆模型预训练,红灯检测的F1得分为89%,显著优于其他方法(行为克隆为86%,前向模型为60%)。
- 在新城镇场景中,预训练策略在常规场景中达到83%的成功率,在密集场景中为25%,而端到端训练分别为71%和12%,表明泛化能力得到提升。
- 在密集场景中,使用专家示范进行预训练使红灯停车的成功率达到90%,而端到端行为克隆仅为8%。
- 线性探测显示,逆模型预训练在左转任务中实现了最低的MAE(0.17°),并在红灯检测中取得最高的F1得分(89%),表明表征质量更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。