[论文解读] Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation
HRViT 通过将多分支架构与自注意力机制相结合,提出了一种用于语义分割的多尺度、高分辨率 Vision Transformer 主干网络,以提升空间精度和语义丰富性。其在 ADE20K 上达到 50.20% 的 mIoU,在 Cityscapes 上达到 83.16%,优于 SOTA 模型如 MiT 和 CSWin,mIoU 提升 +1.78%,同时参数量减少 28%,FLOPs 减少 21%。
Vision Transformers (ViTs) have emerged with superior performance on computer vision tasks compared to convolutional neural network (CNN)-based models. However, ViTs are mainly designed for image classification that generate single-scale low-resolution representations, which makes dense prediction tasks such as semantic segmentation challenging for ViTs. Therefore, we propose HRViT, which enhances ViTs to learn semantically-rich and spatially-precise multi-scale representations by integrating high-resolution multi-branch architectures with ViTs. We balance the model performance and efficiency of HRViT by various branch-block co-optimization techniques. Specifically, we explore heterogeneous branch designs, reduce the redundancy in linear layers, and augment the attention block with enhanced expressiveness. Those approaches enabled HRViT to push the Pareto frontier of performance and efficiency on semantic segmentation to a new level, as our evaluation results on ADE20K and Cityscapes show. HRViT achieves 50.20% mIoU on ADE20K and 83.16% mIoU on Cityscapes, surpassing state-of-the-art MiT and CSWin backbones with an average of +1.78 mIoU improvement, 28% parameter saving, and 21% FLOPs reduction, demonstrating the potential of HRViT as a strong vision backbone for semantic segmentation.
研究动机与目标
- 解决 Vision Transformers (ViTs) 在语义分割中因单一尺度、低分辨率特征表示而导致的局限性。
- 通过借鉴 HRNet 的多分支架构,将高分辨率、多尺度特征学习引入 ViTs,以提升其性能。
- 通过联合优化注意力模块、前馈网络和嵌入层,提升多分支 ViTs 的效率与可扩展性。
- 在资源受限的平台(如 AR/VR 设备)上,平衡 ViT 主干网络在密集预测任务中的性能与效率。
- 证明纯 ViT 主干网络若采用异构多分支设计,可在分割精度与效率上超越卷积神经网络与顺序 ViT 基线模型。
提出的方法
- 提出一种多分支、高分辨率架构,使网络在全过程中保持并融合多尺度特征,实现跨尺度交互。
- 提出一种增强的局部自注意力机制,移除冗余的键/值,并增加并行卷积路径与非线性激活,以提升表达能力与效率。
- 采用混合尺度卷积前馈网络(FFNs),以增强 MLP 模块中的多尺度特征提取能力。
- 设计高效的 HR 卷积茎和图像块嵌入层,以在降低计算成本的同时保留低级、细粒度的特征。
- 实施异构分支设计,使不同分支使用不同的架构组件(如不同的窗口大小、注意力类型),以平衡性能与效率。
- 应用分支-模块协同优化技术,包括线性层中的冗余减少与辅助残差连接,以在不损失表征能力的前提下提升模型效率。
实验结果
研究问题
- RQ1多分支 Vision Transformer 架构能否有效学习用于语义分割的高分辨率、多尺度表征?
- RQ2如何在保持或提升性能的同时,缓解多分支 ViTs 的高计算成本?
- RQ3在高分辨率 ViTs 中,哪些架构组件与协同优化策略最有效地平衡效率与表征质量?
- RQ4在密集预测任务中,将 HRNet 中的残差块替换为 ViT 块,是否能优于顺序 ViT 主干网络?
- RQ5纯 ViT 主干网络若采用异构多分支设计,是否能在语义分割中超越卷积型 HRNet 变体与顺序 ViT 模型?
主要发现
- HRViT 在 ADE20K 验证集上达到 50.20% 的 mIoU,平均优于此前 SOTA(MiT 与 CSWin)+1.78 mIoU。
- 在 Cityscapes 验证集上,HRViT 达到 83.16% 的 mIoU,显著优于 SOTA ViT 主干网络。
- 与 SOTA 模型相比,HRViT 将模型参数量减少 28%,FLOPs 减少 21%,表明其具有显著的效率优势。
- HRViT-b3 中最优的注意力窗口大小为 9,相比窗口大小 7,mIoU 提升 0.34,仅增加 0.8% 的 FLOPs。
- 过大的窗口尺寸(如 15)导致性能下降 0.26 mIoU,FLOPs 增加 3.7%,表明性能在超过最优设置后开始下降。
- 原始 HRNet-ViT 基线(直接替换块)因计算成本过高而难以高效扩展,凸显 HRViT 中协同优化技术的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。