[论文解读] DS-PASS: Detail-Sensitive Panoramic Annular Semantic Segmentation through SwaftNet for Surrounding Sensing
本文提出 DS-PASS,一种针对全景环形影像的细节敏感型全景语义分割框架,通过 SwaftNet——一种实时、注意力增强的编码器-解码器网络,结合侧向跳跃连接,实现对预训练针孔相机语义分割网络在全景影像上的适配。该方法在扩展的 PASS 数据集上实现了最先进性能,并在移动机器人和改装车辆上部署时展现出稳健的实时推理能力与改进的视觉里程计表现。
Semantically interpreting the traffic scene is crucial for autonomous transportation and robotics systems. However, state-of-the-art semantic segmentation pipelines are dominantly designed to work with pinhole cameras and train with narrow Field-of-View (FoV) images. In this sense, the perception capacity is severely limited to offer higher-level confidence for upstream navigation tasks. In this paper, we propose a network adaptation framework to achieve Panoramic Annular Semantic Segmentation (PASS), which allows to re-use conventional pinhole-view image datasets, enabling modern segmentation networks to comfortably adapt to panoramic images. Specifically, we adapt our proposed SwaftNet to enhance the sensitivity to details by implementing attention-based lateral connections between the detail-critical encoder layers and the context-critical decoder layers. We benchmark the performance of efficient segmenters on panoramic segmentation with our extended PASS dataset, demonstrating that the proposed real-time SwaftNet outperforms state-of-the-art efficient networks. Furthermore, we assess real-world performance when deploying the Detail-Sensitive PASS (DS-PASS) system on a mobile robot and an instrumented vehicle, as well as the benefit of panoramic semantics for visual odometry, showing the robustness and potential to support diverse navigational applications.
研究动机与目标
- 解决将基于窄视场(FoV)针孔影像训练的语义分割模型迁移到全景环形影像时性能下降的问题。
- 通过改进编码器与解码器之间的特征融合,提升全景语义分割中对小尺寸或远距离物体(如行人和人行道)的细节敏感度。
- 在无需全新大规模全景标注的前提下,实现在百万像素分辨率全景影像上的高效、实时语义分割。
- 验证全景语义在真实世界自主导航任务(包括视觉里程计和车辆级感知)中的鲁棒性与实用性。
提出的方法
- 提出一种网络适配框架,复用预训练针孔影像语义分割模型的知识,用于全景环形影像,避免领域偏移与图像边界处的盲区。
- 提出 SwaftNet,一种基于注意力机制的实时语义分割网络,通过深层上下文丰富的编码器层与浅层细节敏感的解码器层之间的侧向注意力连接,实现高效特征融合。
- 采用侧向注意力模块,动态加权并融合低层空间细节与高层语义特征,提升对细粒度物体的分割精度。
- 通过为行人、人行道和道路标线等对细节敏感的类别添加细粒度标注,扩展 PASS 数据集,以更准确评估细节敏感度。
- 在搭载 360°×70° 环形镜头系统的移动机器人和改装电动车辆上部署 DS-PASS 系统,验证其在真实场景中的鲁棒性与性能表现。
- 将全景语义预测结果与最先进视觉里程计系统(PALVO)集成,利用语义一致性过滤关键点匹配,提升轨迹平滑度。
实验结果
研究问题
- RQ1能否在不造成灾难性性能下降的前提下,有效将基于窄视场针孔影像训练的预训练语义分割模型适配到全景环形影像?
- RQ2基于注意力的特征融合在全景语义分割中如何提升对小尺寸或远距离物体的细节敏感度?
- RQ3全景语义分割在动态真实环境中在多大程度上提升了视觉里程计的鲁棒性与准确性?
- RQ4像 SwaftNet 这类实时高效分割网络能否在保持高精度的同时,应对百万像素分辨率的全景影像,并超越现有高效架构?
主要发现
- 所提出的网络适配策略在应用于全景环形影像时,对所有最先进高效分割器均一致提升了性能。
- SwaftNet 在扩展的 PASS 数据集上实现了新的最先进性能,优于现有高效网络,同时保持了实时推理速度。
- 在移动机器人上部署的 DS-PASS 系统即使在非理想垂直视角下仍能保持高质量分割,展现出对透视失真的鲁棒性。
- 在改装电动车辆上,系统生成了清晰、定义明确的道路语义地图,使其在单摄像头配置下特别适用于智能车辆(IV)应用。
- 基于 DS-PASS 预测结果的语义感知视觉里程计(语义 PALVO)相比基线方法生成了更平滑的轨迹,速度标准差更低,减少了漂移并提升了鲁棒性。
- 当使用基线分割模型时,语义 PALVO 系统因关键点匹配稀疏且不准确而频繁失效,证实了 DS-PASS 在导航任务中保持细节的分割能力具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。