Skip to main content
QUICK REVIEW

[论文解读] A Baseline for the Commands For Autonomous Vehicles Challenge

Simon Vandenhende, Thierry Deruyttere|arXiv (Cornell University)|Apr 20, 2020
Autonomous Vehicle Technology and Safety参考文献 6被引用 8
一句话总结

本论文提出了一种基于PyTorch的基线模型,用于Commands For Autonomous Vehicles(C4AV)挑战赛,该挑战赛旨在通过图像-命令对齐实现自动驾驶汽车中自由形式自然语言的对象指代。模型采用微调后的CenterNet生成区域提议,使用ResNet-18编码区域特征,使用双向GRU编码命令,并通过二元交叉熵损失进行训练,以最大化与真实框的相关性,在验证集上达到43.5%的AP50。

ABSTRACT

The Commands For Autonomous Vehicles (C4AV) challenge requires participants to solve an object referral task in a real-world setting. More specifically, we consider a scenario where a passenger can pass free-form natural language commands to a self-driving car. This problem is particularly challenging, as the language is much less constrained compared to existing benchmarks, and object references are often implicit. The challenge is based on the recent exttt{Talk2Car} dataset. This document provides a technical overview of a model that we released to help participants get started in the competition. The code can be found at https://github.com/talk2car/Talk2Car.

研究动机与目标

  • 为Commands For Autonomous Vehicles(C4AV)挑战赛提供一个强大且可复现的基线,该挑战赛涉及在真实驾驶场景中将自由形式的自然语言命令对齐到特定对象上。
  • 解决自动驾驶场景中隐含且非约束性语言指代的挑战,其中对象指代通常依赖上下文且未明确命名。
  • 通过发布完整、文档齐全的模型实现,包含训练与推理流程,使参与者能够快速上手机器。
  • 通过在正样本与负样本区域提议之间平衡损失,提升模型在对象对齐任务中的鲁棒性,缓解对负样本的偏差。

提出的方法

  • 使用微调后的CenterNet模型从输入图像中提取区域提议,每张图像生成64个提议,并通过非极大值抑制去除重复项。
  • 选择置信度得分最高的16个区域提议进行进一步处理,形成用于对齐的候选对象区域。
  • 使用预训练的ResNet-18提取图像特征,同时使用双向GRU网络对自然语言命令进行编码。
  • 在对图像区域嵌入和命令嵌入进行L2归一化后,通过线性映射将其重映射到[0,1]区间,作为对齐得分。
  • 模型使用二元交叉熵损失进行训练,该损失分别对正样本(IoU ≥ 0.5)和负样本(IoU < 0.5)的损失进行独立平均,以防止类别不平衡。
  • 训练采用带有Nesterov动量(0.9)的SGD优化器,初始初始学习率0.01,每4个周期衰减10倍,批量大小18,权重衰减1e-4,单张NVIDIA 1080 Ti GPU上训练10个周期。

实验结果

研究问题

  • RQ1如何使深度学习模型在真实自动驾驶车辆场景中有效对齐自由形式的自然语言命令与特定对象?
  • RQ2在驾驶场景下,图像与非约束性语言描述之间跨模态对齐的稳健且高效的基线架构是什么?
  • RQ3在训练过程中,如何缓解正负区域提议之间的类别不平衡问题,以提升模型泛化能力?
  • RQ4在C4AV基准中,通过简单而有效的现成图像与语言编码器融合,可达到怎样的性能水平?

主要发现

  • 该基线模型在C4AV验证集上实现了0.5 IoU下的平均精度(AP50)为43.5%,为竞赛参与者提供了强有力的起点。
  • 对正样本与负样本损失项分别进行平均,有效减少了对负样本预测的偏差,提升了模型收敛性与性能。
  • 模型在单张NVIDIA 1080 Ti GPU上仅用两小时即可完成训练,便于快速原型设计与实验。
  • 在Talk2Car数据集上微调CenterNet,可生成每张图像64个高质量区域提议,这对有效对齐至关重要。
  • 结合ResNet-18提取视觉特征与双向GRU进行语言编码,能够有效学习跨模态相关性。
  • 代码库(包括区域提议与模型权重)已公开发布于https://github.com/talk2car/Talk2Car,支持完全可复现性与社区扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。