Skip to main content
QUICK REVIEW

[论文解读] OffRoadTranSeg: Semi-Supervised Segmentation using Transformers on OffRoad environments

Anukriti Singh, Kartikeya Singh|arXiv (Cornell University)|Jun 26, 2021
Advanced Neural Network Applications参考文献 23被引用 11
一句话总结

OffRoadTranSeg 提出了一种新颖的半监督语义分割框架,用于非结构化越野环境,采用视觉变换器和自动数据选择。通过微调自监督的 DINO 主干网络,并利用基于深度的主动学习选择多样化、高信息量的图像,该方法在 RELLIS-3D 和 RUGD 数据集上实现了最先进(SOTA)的 mIoU 性能,完全解决了类别不平衡问题,对以往未检测到的类别(如木头和碎屑)实现了 96% 的 mIoU。

ABSTRACT

We present OffRoadTranSeg, the first end-to-end framework for semi-supervised segmentation in unstructured outdoor environment using transformers and automatic data selection for labelling. The offroad segmentation is a scene understanding approach that is widely used in autonomous driving. The popular offroad segmentation method is to use fully connected convolution layers and large labelled data, however, due to class imbalance, there will be several mismatches and also some classes may not be detected. Our approach is to do the task of offroad segmentation in a semi-supervised manner. The aim is to provide a model where self supervised vision transformer is used to fine-tune offroad datasets with self-supervised data collection for labelling using depth estimation. The proposed method is validated on RELLIS-3D and RUGD offroad datasets. The experiments show that OffRoadTranSeg outperformed other state of the art models, and also solves the RELLIS-3D class imbalance problem.

研究动机与目标

  • 解决越野语义分割中的类别不平衡问题,特别是在 RELLIS-3D 等数据集中某些类别(如木头、水)标注稀少的问题。
  • 减少在边界不明确的非结构化户外环境中进行昂贵且耗时的完整实例标注的需求。
  • 利用自监督视觉变换器提升在极少人工标注数据下的分割性能。
  • 开发一种自动数据选择策略,识别每段序列中最 informative 的图像,以最少的标注实现最高分割精度。
  • 通过结合基于变换器的特征学习与主动学习,在越野数据集上实现最先进性能,提升标签效率。

提出的方法

  • 在无需任何人工标注标签的情况下,对越野数据集微调自监督视觉变换器(DINO),以学习鲁棒的特征表示。
  • 利用预训练 DINO 模型的深度估计结果,识别并选择最具多样性、高信息量的图像用于标注。
  • 应用自动数据选择(ADS)算法,从每段序列中选择最多 25 张图像,以最大化特征多样性并覆盖稀有类别。
  • 在选定的图像子集(每段序列少于 25 张)上,使用半监督学习范式训练分割头。
  • 利用视觉变换器的注意力图引导特征学习,提升在复杂、杂乱越野场景中的泛化能力。
  • 在 RELLIS-3D 和 RUGD 上端到端评估模型,对比所有类别(包括以往表现不佳的类别)的性能。

实验结果

研究问题

  • RQ1自监督视觉变换器是否能在无任何人工标注数据的情况下,有效学习越野场景的表征?
  • RQ2基于深度估计的自动数据选择是否能显著减少所需标注数量,同时提升分割精度?
  • RQ3所提出的方法能否克服 RELLIS-3D 等越野数据集中类别不平衡问题,其中某些类别(如木头、碎屑)在现有模型中几乎无法检测?
  • RQ4在半监督越野分割任务中,基于变换器的方法相较于基于 CNN 的 SOTA 模型(如 HRNet)性能如何?
  • RQ5主动数据选择在整段视频序列中在多大程度上提升了分割性能,特别是在误差累积通常发生的后期帧中?

主要发现

  • OffRoadTranSeg 在 RELLIS-3D 数据集上仅使用每段序列少于 25 张标注图像,即实现了 88% 的平均交并比(mIoU),优于以往的 SOTA 方法。
  • 该模型完全解决了 RELLIS-3D 中的类别不平衡问题,对以往未检测到的类别“木头”实现了 96% 的 mIoU,而 HRNet 基线模型的 mIoU 为 0%。
  • 在 RUGD 数据集上,OffRoadTranSeg 在多个类别上的 IoU 值高于原始 RUGD 基准报告的结果。
  • ViT-small 主干网络表现优于其他架构,在相同半监督设置下达到 88% mIoU,而 ResNet-50 仅达到 36% mIoU。
  • 自动数据选择(ADS)的使用显著提升了视频序列后期帧的性能,最后一批(bn)图像中对复杂类别(如木头和灌木)的分割效果显著。
  • 自监督预训练与主动数据选择的结合,在降低标注成本的同时,提升了在非结构化户外环境中的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。