Skip to main content
QUICK REVIEW

[论文解读] Learning to Drive Anywhere

Ruizhao Zhu, Peng Huang|arXiv (Cornell University)|Sep 21, 2023
Traffic Prediction and Management TechniquesEngineering被引用 3
一句话总结

本文提出 AnyD,一种地理感知的端到端图像到鸟瞰图(BEV)轨迹预测模型,直接回归 BEV 位姿点,无需中间的图像级热力图或软 argmax 操作。通过结合城市级别的嵌入与区域通道注意力模块,AnyD 在多城市基准上实现 1.93 的 FDE,且能有效泛化至未见过的城市(如广州),在 CARLA 的开放环和闭环评估中均优于非地理感知基线模型。

ABSTRACT

Human drivers can seamlessly adapt their driving decisions across geographical locations with diverse conditions and rules of the road, e.g., left vs. right-hand traffic. In contrast, existing models for autonomous driving have been thus far only deployed within restricted operational domains, i.e., without accounting for varying driving behaviors across locations or model scalability. In this work, we propose AnyD, a single geographically-aware conditional imitation learning (CIL) model that can efficiently learn from heterogeneous and globally distributed data with dynamic environmental, traffic, and social characteristics. Our key insight is to introduce a high-capacity geo-location-based channel attention mechanism that effectively adapts to local nuances while also flexibly modeling similarities among regions in a data-driven manner. By optimizing a contrastive imitation objective, our proposed approach can efficiently scale across inherently imbalanced data distributions and location-dependent events. We demonstrate the benefits of our AnyD agent across multiple datasets, cities, and scalable deployment paradigms, i.e., centralized, semi-supervised, and distributed agent training. Specifically, AnyD outperforms CIL baselines by over 14% in open-loop evaluation and 30% in closed-loop testing on CARLA.

研究动机与目标

  • 解决在交通规则、基础设施和驾驶行为各异的多样化城市环境中训练端到端驾驶代理的挑战。
  • 克服先前图像到 BEV 规划器依赖中间热力图回归与软 argmax 所带来的特征映射表达能力受限的问题。
  • 通过显式建模区域驾驶特征实现对新城市的零样本与少样本适应,提升泛化能力。
  • 在开放环轨迹预测与闭环仿真(CARLA)中均展现稳健性能,包括提升成功率与减少违规行为。

提出的方法

  • 提出一种简化网络架构,直接从图像与速度特征回归 BEV 位姿点,消除上采样与热力图生成步骤。
  • 引入区域通道注意力模块,利用城市级别嵌入(地理条件模块)调制特征图,实现区域感知的表征学习。
  • 采用在 ImageNet 上预训练的 ResNet-34 主干网络,输入图像调整为 400×225,通过 3×3 卷积融合图像与速度特征,再输入全连接层。
  • 利用多城市数据集(Argoverse 2、nuScenes、Waymo)并采用从 GPS 与 LiDAR 自车位姿导出的标准 BEV 位姿点标注。
  • 采用监督与半监督学习相结合的方式训练:使用 AnyD 对 11 个城市 YouTube 视频进行伪标签生成,随后在混合数据上微调。
  • 对 OSM GPS 轨迹应用 K-means 聚类以定义城市子区域,实现地理条件监督,即使在 GPS 精度不足时亦可实现。

实验结果

研究问题

  • RQ1单一端到端模型是否能在无需显式领域自适应的情况下,泛化至具有不同交通规则与基础设施的多样化城市环境?
  • RQ2移除中间图像级热力图与软 argmax 是否能提升 BEV 位姿点预测性能与泛化能力?
  • RQ3地理条件特征调制在多大程度上提升了对存在领域差距的新城市的零样本与少样本适应能力?
  • RQ4该模型在闭环仿真中的表现如何,特别是在处理左侧行驶、限速差异等区域驾驶行为方面?

主要发现

  • 所提出的无中间热力图架构将 FDE 从 2.45 降低至 2.17,提升 12.9%,参数量仅小幅增加(2380 万 vs. 2410 万)。
  • 引入包含三个适配器的地理条件模块后,FDE 进一步降低至 1.93,相比使用新损失函数的基线模型提升 11.1%。
  • 在 CARLA 中,AnyD 提升了闭环指标:驾驶评分从 0.36 提升至 0.50(相对提升 38.9%),成功率从 29% 提升至 36%,路线完成率从 50% 提升至 69%。
  • 在对广州(中国)微调后,AnyD 在已见城市上的性能保持稳定(FDE:1.05 → 1.04),同时在新城市上实现 0.84 的 FDE,优于非地理感知基线模型(1.33 FDE)。
  • 定性结果表明,AnyD 在复杂操作(如并线与转向)中泛化能力更强,尤其在交通方向性与限速差异显著的区域表现更优。
  • 失败案例主要源于罕见或密集交通行为,表明在极端或非典型场景下存在鲁棒性边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。