Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptation with Joint Learning for Generic, Optical Car Part Recognition and Detection Systems (Go-CaRD)

Lukas Stappen, Xinchen Du|arXiv (Cornell University)|Jun 15, 2020
Advanced Neural Network Applications参考文献 43被引用 4
一句话总结

本文提出 Go-CaRD,一种基于联合学习与领域自适应的通用光学汽车零配件识别与检测系统,旨在提升在多样化真实汽车环境下的性能。通过在包含人车交互的新型公开数据集 MuSe-CAR-Part 上进行训练,该方法在识别任务中达到 93.67% 的 F1 分数,在检测任务中达到 63.01% 的 mAP,相较于标准微调和无监督领域自适应方法,在测试集上的 mAP 提升超过 5 个百分点的绝对增益。

ABSTRACT

Systems for the automatic recognition and detection of automotive parts are crucial in several emerging research areas in the development of intelligent vehicles. They enable, for example, the detection and modelling of interactions between human and the vehicle. In this paper, we quantitatively and qualitatively explore the efficacy of deep learning architectures for the classification and localisation of 29 interior and exterior vehicle regions on three novel datasets. Furthermore, we experiment with joint and transfer learning approaches across datasets and point out potential applications of our systems. Our best network architecture achieves an F1 score of 93.67 % for recognition, while our best localisation approach utilising state-of-the-art backbone networks achieve a mAP of 63.01 % for detection. The MuSe-CAR-Part dataset, which is based on a large variety of human-car interactions in videos, the weights of the best models, and the code is publicly available to academic parties for benchmarking and future research.

研究动机与目标

  • 开发一种通用且鲁棒的系统,用于在真实世界、多变条件下对 29 种内饰与外饰汽车零配件进行光学识别与检测。
  • 解决在动态、人机交互环境中细粒度汽车零配件检测缺乏数据集与模型的问题。
  • 通过引入结合源域与目标域数据进行训练的联合学习与领域自适应框架,提升模型在不同领域间的泛化能力。
  • 发布一个新构建的大规模、公开可用的数据集(MuSe-CAR-Part)及训练好的模型,以支持未来在汽车计算机视觉领域的研究与基准测试。

提出的方法

  • 作者创建了三个新数据集:Close-CAR(近距离、次优条件)、Mix-CAR(多车型、多配置)以及 MuSe-CAR-Part(人车交互视频),其中后者已公开发布。
  • 采用最先进的 CNN 主干网络(如 Darknet),并将其适配用于联合学习,即同时训练来自源域(无人体)与目标域(存在人体遮挡)的特征。
  • 领域自适应策略通过联合训练来自两个域的数据,使模型能够学习共享表征,同时适应由人车交互和光照变化引起的分布偏移。
  • 通过使用 ImageNet 权重初始化网络,并在汽车特定数据上进行微调,结合领域特定数据通过联合优化进行迁移学习。
  • 在检测任务中,采用两阶段目标检测器(如 Faster R-CNN)并引入特征融合机制,以提升在遮挡和视角变化下的定位精度。
  • 系统使用标准指标进行评估:识别任务使用 F1 分数,检测任务使用平均精度均值(mAP),并通过消融实验对比联合学习、微调与无监督领域自适应方法。

实验结果

研究问题

  • RQ1在真实世界、多变条件下,跨源域与目标域的联合学习是否能提升汽车零配件识别与检测的泛化能力?
  • RQ2在未见的汽车数据集上,联合领域自适应相较于标准微调与无监督领域自适应,在 mAP 与 F1 分数上的表现如何?
  • RQ3在包含遮挡与动态光照的人车交互场景中,基于多样化车型与配置训练的通用模型,其泛化能力能达到何种程度?
  • RQ4在训练过程中引入含人体遮挡的数据,特别是在真实世界视频序列中,能带来多大的性能提升?

主要发现

  • 最佳识别模型在分类数据集测试集上达到 93.67% 的 F1 分数,证明其在识别 29 种汽车零配件方面具有高精度。
  • 采用联合学习的检测系统在 Mix-CAR 数据集测试集上达到 63.01% 的 mAP,显著优于标准微调与无监督领域自适应方法。
  • 在人车交互数据集(MuSe-CAR-Part)上,联合学习将 mAP 从微调基线的 29.62% 提升至 41.07%,实现 10 个百分点的绝对增益。
  • 与标准迁移学习及无监督领域自适应相比,联合学习在 Mix-CAR 的开发集与测试集上 mAP 均提升超过 5 个百分点的绝对增益。
  • 包含真实世界人车交互视频的 MuSe-CAR-Part 数据集被成功用于模型训练与评估,证明其对遮挡与可变视角具有鲁棒性。
  • MuSe-CAR-Part 数据集、训练好的模型及代码的发布,为未来在智能车辆感知与人车交互领域的基准测试提供了支持,并加速了相关研究进展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。