[论文解读] WEDGE: Web-Image Assisted Domain Generalization for Semantic Segmentation
WEDGE 提出了一种基于网络图像的领域自适应语义分割框架,通过利用多样化的、与应用相关的网络爬取图像,提升模型在未见领域中的泛化能力。通过在训练过程中实时将网络图像风格注入合成训练图像,并在两阶段训练流程中使用伪标签化的网络图像,WEDGE 实现了当前最优的性能,在多个真实世界测试领域上的平均性能优于现有方法 5.5%。
Domain generalization for semantic segmentation is highly demanded in real applications, where a trained model is expected to work well in previously unseen domains. One challenge lies in the lack of data which could cover the diverse distributions of the possible unseen domains for training. In this paper, we propose a WEb-image assisted Domain GEneralization (WEDGE) scheme, which is the first to exploit the diversity of web-crawled images for generalizable semantic segmentation. To explore and exploit the real-world data distributions, we collect web-crawled images which present large diversity in terms of weather conditions, sites, lighting, camera styles, etc. We also present a method which injects styles of the web-crawled images into training images on-the-fly during training, which enables the network to experience images of diverse styles with reliable labels for effective training. Moreover, we use the web-crawled images with their predicted pseudo labels for training to further enhance the capability of the network. Extensive experiments demonstrate that our method clearly outperforms existing domain generalization techniques.
研究动机与目标
- 解决语义分割中领域自适应的挑战,即模型必须在未获取其数据的情况下泛化到未见的真实世界领域。
- 克服现有领域自适应方法依赖有限风格源(如 ImageNet)的局限性,这些风格源通常与目标应用场景无关。
- 利用真实世界网络爬取图像的多样性——涵盖天气、光照、相机风格和地理位置——以实现更有效且更真实的领域自适应。
- 开发一种高效、实时的风格注入机制,将网络图像的视觉风格转移到合成训练数据上,而无需进行图像到图像的转换。
- 通过在两阶段训练流程中使用预测的伪标签对网络爬取图像进行增强,提升模型的泛化能力。
提出的方法
- 使用与应用相关的关键词(如 'driving + road')从网络爬取图像,以确保其与目标领域的相关性。
- 风格注入模块在训练过程中实时将网络图像的特征级风格转移到合成训练图像上,利用早期残差块(ResNet 为第1和第2个,VGG 为第2和第3个)的特征统计量。
- 训练过程分为两个阶段:在阶段1中,使用合成图像进行风格注入训练;在阶段2中,将带有预测伪标签的网络爬取图像作为额外训练数据加入。
- 网络爬取图像的伪标签由阶段1训练好的模型生成,置信度阈值超参数 τ 控制标签质量。
- 该方法通过直接在特征图上操作,避免了昂贵的图像到图像转换,从而实现对大规模网络图像集合的高效利用。
- 消融实验证实,在深层(如第4个残差块)注入风格会降低性能,从而验证了在早期特征图上进行风格迁移的合理性。

实验结果
研究问题
- RQ1具有多样化真实世界特征的网络爬取图像是否能超越合成数据,在语义分割的领域自适应中实现更好的泛化?
- RQ2与图像到图像转换或随机风格增强相比,基于网络图像的实时特征级风格注入是否能带来更好的泛化性能?
- RQ3即使语义上不相关,使用两阶段训练策略时,带有伪标签的网络爬取图像是否能有效提升模型的鲁棒性?
- RQ4网络图像关键词的选择(如 'driving + fog' 与 'driving + road')如何影响模型的泛化性能?
- RQ5用于风格注入的最佳特征层组合是什么?以在保持语义一致性的同时增强领域自适应能力?
主要发现
- WEDGE 在三个真实世界测试数据集(Cityscapes、BDD100K、Mapillary)上达到当前最优性能,当使用 ResNet101 在 GTA5 上训练时,Cityscapes 测试集的平均 mIoU 达到 47.30%。
- 该方法在平均 mIoU 上相比先前的领域自适应方法最高提升 5.5%,显著提升了跨领域泛化能力。
- 使用通用关键词 'driving + road' 进行网络图像检索,性能优于领域特定关键词如 'driving + fog'(mIoU 分别为 43.73% 和 43.39%)。
- 两阶段训练流程结合伪标签化显著提升性能,相比仅使用第一阶段的模型,mIoU 提升 2.5–3.5%,证实了额外网络图像数据的有效性。
- 消融实验证明,在深层(如第4个残差块)注入风格会损害性能,表明早期特征更适用于风格迁移。
- 使用 τ = 0.05 的伪标签阈值能实现标签质量与训练稳定性的最佳平衡,而更低阈值(如 τ = 0.01)会导致性能下降。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。