[论文解读] Affordance Learning In Direct Perception for Autonomous Driving
本文提出了一种用于自动驾驶的直接感知方法,通过训练定制的卷积神经网络(CNN),从谷歌街景图像和开放街图(OpenStreetMap)矢量数据中学习驾驶可操作性(affordances),仅使用三分之一的训练数据即实现了与预训练模型相当的性能。该方法实现了高效、低成本的数据采集与标注,并在不同地理区域和驾驶条件下展现出强大的泛化能力。
Recent development in autonomous driving involves high-level computer vision and detailed road scene understanding. Today, most autonomous vehicles are using mediated perception approach for path planning and control, which highly rely on high-definition 3D maps and real time sensors. Recent research efforts aim to substitute the massive HD maps with coarse road attributes. In this paper, we follow the direct perception based method to train a deep neural network for affordance learning in autonomous driving. Our goal in this work is to develop the affordance learning model based on freely available Google Street View panoramas and Open Street Map road vector attributes. Driving scene understanding can be achieved by learning affordances from the images captured by car-mounted cameras. Such scene understanding by learning affordances may be useful for corroborating base maps such as HD maps so that the required data storage space is minimized and available for processing in real time. We compare capability in road attribute identification between human volunteers and our model by experimental evaluation. Our results indicate that this method could act as a cheaper way for training data collection in autonomous driving. The cross validation results also indicate the effectiveness of our model.
研究动机与目标
- 开发一种低成本、可扩展的方法,用于训练自动驾驶感知模型,而无需依赖昂贵的高精地图。
- 通过利用免费获取的地理空间数据(谷歌街景和开放街图),提高数据采集与标注的效率。
- 验证可操作性学习模型在不同地理区域和驾驶条件下的泛化能力。
- 基于上下文场景理解,而非静态标签,优化驾驶可操作性的定义。
- 证明未经预训练的CNN可在仅使用较小数据集的情况下,达到与最先进模型相当的性能。
提出的方法
- 利用谷歌街景全景图和开放街图矢量数据,自动标注训练数据,无需人工标注。
- 基于VGG11和AlexNet设计定制的CNN架构,从随机初始化开始训练,以从单张前视图像中检测道路可操作性。
- 引入一种新型重缩放因子(RF),以减轻将模型适配至KITTI数据集图像时因输入尺寸不兼容而产生的失真。
- 采用交叉验证和多区域测试(Waterloo, CA,欧洲)评估模型的泛化能力和鲁棒性。
- 基于驾驶上下文优化可操作性定义,例如区分道路路段、自行车道和交通特征。
- 在新的地理数据上验证自动标注流程,确认其在原始旧金山数据集之外的可靠性。
实验结果
研究问题
- RQ1未经预训练的自定义CNN是否能在不使用ImageNet或Places预训练模型的情况下,实现具有竞争力的可操作性预测性能?
- RQ2利用谷歌街景和开放街图的自动标注流程在不同地理区域中的有效性如何?
- RQ3该训练模型在未见过的驾驶环境(如在欧洲采集的KITTI数据集)中泛化的程度如何?
- RQ4输入图像因重缩放导致的失真在多大程度上影响模型对车辆航向角预测的回归性能?
- RQ5静态地理空间数据(OSM)和全景图像(GSV)在捕捉道路施工或天气变化等动态道路状况方面存在哪些局限性?
主要发现
- 所提出的自定义CNN在仅使用三分之一训练图像且从随机初始化训练的情况下,性能与使用预训练权重的模型相当。
- 该模型在不同地理区域间展现出强大的泛化能力,成功预测了来自Waterloo(加拿大)、旧金山(美国)和KITTI(欧洲)的数据中的可操作性。
- 应用重缩放因子(RF)显著提高了模型在KITTI图像上的航向角预测精度,减少了失真引起的误差。
- 自动标注流程在新的地理环境(Waterloo)中得到验证,确认其在原始旧金山数据集之外的鲁棒性。
- 标注精度的局限性主要归因于GSV数据中GPS/IMU定位误差,以及在信号遮挡或道路属性过时的城区中OSM数据的不一致性。
- 静态的GSV和OSM数据无法捕捉道路施工或恶劣天气等动态变化,凸显了未来模型中集成动态数据的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。