[论文解读] Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation
本文提出 Trans4PASS+,一种针对全景语义分割的畸变感知视觉Transformer,通过集成可变形块嵌入(DPE)与可变形MLP(DMLPv2),有效处理360°等距圆柱投影图像中的严重图像畸变与物体形变。此外,该方法进一步提出一种互原型自适应(MPA)策略,并结合伪标签校正,实现无监督域自适应,在四种基准测试中均取得最先进性能,采用针孔相机到全景图(Pinhole-to-Panoramic)与合成数据到真实数据(Synthetic-to-Real)两种域自适应范式,其性能得到新数据集 SynPASS 的支持。
In this paper, we address panoramic semantic segmentation which is under-explored due to two critical challenges: (1) image distortions and object deformations on panoramas; (2) lack of semantic annotations in the 360° imagery. To tackle these problems, first, we propose the upgraded Transformer for Panoramic Semantic Segmentation, i.e., Trans4PASS+, equipped with Deformable Patch Embedding (DPE) and Deformable MLP (DMLPv2) modules for handling object deformations and image distortions whenever (before or after adaptation) and wherever (shallow or deep levels). Second, we enhance the Mutual Prototypical Adaptation (MPA) strategy via pseudo-label rectification for unsupervised domain adaptive panoramic segmentation. Third, aside from Pinhole-to-Panoramic (Pin2Pan) adaptation, we create a new dataset (SynPASS) with 9,080 panoramic images, facilitating Synthetic-to-Real (Syn2Real) adaptation scheme in 360° imagery. Extensive experiments are conducted, which cover indoor and outdoor scenarios, and each of them is investigated with Pin2Pan and Syn2Real regimens. Trans4PASS+ achieves state-of-the-art performances on four domain adaptive panoramic semantic segmentation benchmarks. Code is available at https://github.com/jamycheung/Trans4PASS.
研究动机与目标
- 解决由于等距圆柱投影导致的全景语义分割中图像畸变与物体形变的挑战。
- 通过实现无监督域自适应(UDA)缓解360°图像中密集语义标注稀缺的问题。
- 开发一种在不同视场角(FoV)和域偏移下均具备鲁棒性的模型架构。
- 构建一个新的合成全景数据集 SynPASS,以支持360°场景中从合成到真实(Syn2Real)的域自适应。
- 通过联合利用有标签源域数据与伪标签目标域数据,借助互原型学习提升域自适应性能。
提出的方法
- 提出可变形块嵌入(DPE),在块划分过程中学习全景图特有的归纳偏置,提升在畸变条件下的特征表示能力。
- 引入具有并行令牌混合机制的可变形MLP(DMLPv2),增强浅层与深层的特征精炼能力,提升对视场角变化的鲁棒性。
- 开发互原型自适应(MPA)策略,通过源域与目标域的互原型联合优化特征空间与输出空间对齐。
- 在MPA中引入伪标签校正机制,降低不完整或不准确伪标签带来的噪声,提升在真实世界目标域上的泛化能力。
- 提出 SynPASS,一个包含9,080张全景图像的新数据集,支持360°场景中的监督训练与Syn2Real域自适应。
- 采用双阶段域自适应范式:针孔相机到全景图(Pin2Pan)与合成数据到真实数据(Syn2Real),实现更广泛的域偏移泛化能力。
实验结果
研究问题
- RQ1视觉Transformer架构能否被有效适配以处理360°全景图像中的严重几何畸变与物体形变?
- RQ2当缺乏目标域标注数据时,如何提升全景语义分割中的无监督域自适应性能?
- RQ3从源域与目标域中联合学习互原型,能在多大程度上缓解全景分割中的域偏移问题?
- RQ4新构建的合成全景数据集(SynPASS)能否有效支持从合成数据到真实世界360°场景的域泛化?
- RQ5畸变感知模块与MPA的集成是否能在不同域与视场角下持续带来性能提升?
主要发现
- Trans4PASS+ 在四个域自适应全景语义分割基准上均取得最先进性能,涵盖Pin2Pan与Syn2Real两种设置。
- 该模型在不同视场角(FoV)下保持稳定性能,mIoU在从窄视场到360°的扩展过程中依然稳健。
- 在仅使用源域数据的设置下,Trans4PASS+ 在室内(SPin → SPan)与室外(CS → DP)域中均取得显著的mIoU提升,展现出内在鲁棒性。
- MPA策略使无监督模型在目标域上的表现优于基于SAM的自监督学习方法以及先前的全监督模型。
- t-SNE可视化结果表明,MPA成功对齐了源域与目标域的特征分布,互原型在特征空间中更加接近。
- 由SynPASS支持的Syn2Real域自适应方案表现强劲,尤其在识别具有稳定形状与纹理的物体方面;而Pin2Pan在检测具有丰富纹理的物体(如交通标志)方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。