Skip to main content
QUICK REVIEW

[论文解读] IDD: A Dataset for Exploring Problems of Autonomous Navigation in Unconstrained Environments

Girish Varma, Anbumani Subramanian|arXiv (Cornell University)|Nov 26, 2018
Advanced Neural Network Applications参考文献 21被引用 4
一句话总结

本论文提出了IDD,一个大规模、精细标注的数据集,包含来自印度道路的10,004张图像,旨在应对在非结构化、多样化环境中的自动驾驶导航挑战。该数据集包含34个语义类别,采用创新的四级标签层级结构,其类内多样性显著高于Cityscapes,导致当前最先进语义分割模型性能大幅下降——凸显了其在领域自适应、少样本学习及真实驾驶场景行为预测方面的推动作用。

ABSTRACT

While several datasets for autonomous navigation have become available in recent years, they tend to focus on structured driving environments. This usually corresponds to well-delineated infrastructure such as lanes, a small number of well-defined categories for traffic participants, low variation in object or background appearance and strict adherence to traffic rules. We propose IDD, a novel dataset for road scene understanding in unstructured environments where the above assumptions are largely not satisfied. It consists of 10,004 images, finely annotated with 34 classes collected from 182 drive sequences on Indian roads. The label set is expanded in comparison to popular benchmarks such as Cityscapes, to account for new classes. It also reflects label distributions of road scenes significantly different from existing datasets, with most classes displaying greater within-class diversity. Consistent with real driving behaviours, it also identifies new classes such as drivable areas besides the road. We propose a new four-level label hierarchy, which allows varying degrees of complexity and opens up possibilities for new training methods. Our empirical study provides an in-depth analysis of the label characteristics. State-of-the-art methods for semantic segmentation achieve much lower accuracies on our dataset, demonstrating its distinction compared to Cityscapes. Finally, we propose that our dataset is an ideal opportunity for new problems such as domain adaptation, few-shot learning and behaviour prediction in road scenes.

研究动机与目标

  • 解决现有数据集局限于欧洲和北美结构化、规则化驾驶环境的局限性。
  • 提供一个大规模、高质量的数据集,捕捉真实世界非结构化道路在视觉与行为上的多样性,尤其聚焦于印度等交通与基础设施复杂的地区。
  • 通过引入具有高类内差异性和稀有或模糊类别的数据集,推动领域自适应、少样本学习及行为预测的新研究。
  • 设计一个多级标签层级结构,支持不同程度的分割复杂度,并减少真实场景理解中的歧义。
  • 通过实证表明泛化挑战:在Cityscapes上训练的SOTA模型在IDD上性能显著下降,表明需要更鲁棒且多样化的训练数据。

提出的方法

  • 在多样化的印度城市与乡村道路中采集182个驾驶序列,涵盖光照、天气、交通密度与道路基础设施的极端变化。
  • 对10,004张图像进行精细实例级标注,涵盖34个语义类别,包括新型类别如三轮车、广告牌、路缘石以及可行驶/不可行驶区域。
  • 设计四级分层标注系统(7、16、26、30个标签),以支持多粒度学习并减少复杂场景中的歧义。
  • 在传统道路/车道标签之外,纳入可行驶区域的语义线索,反映受动态与静态障碍物影响的真实导航决策。
  • 使用mIoU与AP指标,在语义分割与实例分割基准上评估最先进模型(如DeepLabV3、Mask R-CNN)的性能。
  • 通过消融研究与混淆矩阵分析,识别模型失败模式与类别级挑战,例如摩托车与自行车、广告牌与交通标志之间的高度混淆。

实验结果

研究问题

  • RQ1在Cityscapes上训练的最先进语义分割模型,在更复杂多样的非结构化驾驶环境(如印度)中的泛化性能如何?
  • RQ2与结构化基准相比,IDD中物体外观与背景复杂度的高类内差异,对当前语义分割模型构成多大挑战?
  • RQ3所提出的四级标签层级结构在减少歧义与支持复杂道路场景中的多粒度学习方面效果如何?
  • RQ4模型在IDD上的关键失败模式与混淆现象是什么?它们与像素数量与视觉相似性等类别级特征有何关联?
  • RQ5IDD在哪些方面可作为新兴学习范式(如少样本学习与领域自适应)在自动驾驶中的基准?

主要发现

  • 在IDD上微调的最先进语义分割模型,其mIoU得分显著低于在Cityscapes上的表现(例如,第4级为74.3%),表明存在显著的领域偏移与更高难度。
  • 在IDD上训练的模型在非结构化环境中展现出更优的泛化能力,能正确识别出泥泞或非标准可行驶区域,而这些区域常被Cityscapes训练模型忽略。
  • 自行车、交通灯与围栏等类别的IoU值(<25%)较低,主要由于像素数量过少,凸显了稀有类别数据稀缺的问题。
  • 在视觉上相似的类别之间存在显著混淆,如摩托车与自行车、广告牌与交通标志,以及植被与墙体、灯柱、围栏之间,表明细粒度识别存在挑战。
  • 在IDD上,实例分割模型的AP得分最高达0.376(PANet)与0.268(Mask R-CNN),远低于标准基准上的表现,凸显了该数据集的难度。
  • 该数据集揭示,可行驶区域预测高度依赖上下文且存在歧义,需超越几何或车道定义的语义线索,这对传统分割方法构成挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。