Skip to main content
QUICK REVIEW

[论文解读] TransFuser: Imitation with Transformer-Based Sensor Fusion for Autonomous Driving

Kashyap Chitta, Aditya Prakash|arXiv (Cornell University)|May 31, 2022
Advanced Neural Network Applications被引用 12
一句话总结

TransFuser 提出了一种基于 Transformer 的多模态融合架构,通过自注意力机制整合图像与 LiDAR 特征,以捕捉全局 3D 场景上下文,显著提升了端到端模仿学习在自动驾驶中的表现。其在 CARLA 排行榜上取得最先进性能,相比基于几何的融合方法,碰撞率降低了 48%。

ABSTRACT

How should we integrate representations from complementary sensors for autonomous driving? Geometry-based fusion has shown promise for perception (e.g. object detection, motion forecasting). However, in the context of end-to-end driving, we find that imitation learning based on existing sensor fusion methods underperforms in complex driving scenarios with a high density of dynamic agents. Therefore, we propose TransFuser, a mechanism to integrate image and LiDAR representations using self-attention. Our approach uses transformer modules at multiple resolutions to fuse perspective view and bird's eye view feature maps. We experimentally validate its efficacy on a challenging new benchmark with long routes and dense traffic, as well as the official leaderboard of the CARLA urban driving simulator. At the time of submission, TransFuser outperforms all prior work on the CARLA leaderboard in terms of driving score by a large margin. Compared to geometry-based fusion, TransFuser reduces the average collisions per kilometer by 48%.

研究动机与目标

  • 为解决现有传感器融合方法在高交通密度复杂城市驾驶场景中的局限性。
  • 通过整合图像与 LiDAR 模态之间的全局上下文推理,改进模仿学习策略。
  • 开发一种稳健且通用的融合机制,以增强端到端自动驾驶中的感知与决策能力。
  • 建立新的基准,采用长距离、高密度交通路线,以评估驾驶策略的真实性能。
  • 证明注意力机制融合优于局部性基于几何的融合方法,在具有挑战性的驾驶场景中表现更优。

提出的方法

  • TransFuser 使用两个独立的卷积编码器分支,分别独立处理图像与 LiDAR 特征。
  • 采用多分辨率 Transformer 模块,融合来自透视视图与鸟瞰图表示的特征。
  • 注意力机制实现了跨模态特征之间的长距离、成对交互,捕捉全局场景上下文。
  • 将模型集成到自回归的路径点预测框架中,实现端到端驾驶。
  • 采用多任务学习设置,引入辅助监督信号,提升训练稳定性和性能。
  • 在新的 Longest6 基准和官方 CARLA 排行榜上进行评估,涵盖长距离路线与高交通密度场景。

实验结果

研究问题

  • RQ1基于注意力的图像与 LiDAR 融合是否能提升复杂城市驾驶场景中模仿学习的性能?
  • RQ2通过 Transformer 实现的全局上下文建模与基于局部性的几何融合相比,在密集交通中表现如何?
  • RQ3多模态注意力在端到端驾驶中在多大程度上减少了碰撞与违规行为?
  • RQ4所提出的长距离、高密度路线基准如何揭示先前融合方法的局限性?
  • RQ5辅助监督与传感器配置在提升驾驶策略泛化能力方面起到何种作用?

主要发现

  • 在 Longest6 基准上,TransFuser 取得了 56.68 的驾驶得分,显著优于先前方法。
  • 在官方 CARLA 排行榜上,TransFuser 在提交时达到最高驾驶得分,超越所有先前工作。
  • 与基于几何的融合方法相比,TransFuser 将每公里平均碰撞次数减少了 48%。
  • 将摄像头视场角从 90° 增加到 132°,使驾驶得分提升了 7.5 个百分点。
  • 引入速度输入与缓慢行驶行为可降低碰撞率,尤其在高惯性场景中效果显著。
  • 模型在不同随机种子下表现稳健,最佳配置下达到 56.68 的驾驶得分与 92.28% 的碰撞率降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。