Skip to main content
QUICK REVIEW

[论文解读] Learning Statistical Texture for Semantic Segmentation

Lanyun Zhu, Deyi Ji|arXiv (Cornell University)|Mar 6, 2021
Advanced Neural Network Applications参考文献 37被引用 8
一句话总结

该论文提出了一种新型语义分割框架——统计纹理学习网络(STLNet),通过量化与计数算子(QCO)显式建模统计纹理特征。通过纹理增强模块(TEM)增强低级纹理细节,并利用金字塔纹理特征提取模块(PTFEM)提取多尺度统计纹理特征,STLNet在Cityscapes、PASCAL Context和ADE20K数据集上均取得了当前最优性能,mIoU得分分别为82.3%、55.8%和46.48%。

ABSTRACT

Existing semantic segmentation works mainly focus on learning the contextual information in high-level semantic features with CNNs. In order to maintain a precise boundary, low-level texture features are directly skip-connected into the deeper layers. Nevertheless, texture features are not only about local structure, but also include global statistical knowledge of the input image. In this paper, we fully take advantages of the low-level texture features and propose a novel Statistical Texture Learning Network (STLNet) for semantic segmentation. For the first time, STLNet analyzes the distribution of low level information and efficiently utilizes them for the task. Specifically, a novel Quantization and Counting Operator (QCO) is designed to describe the texture information in a statistical manner. Based on QCO, two modules are introduced: (1) Texture Enhance Module (TEM), to capture texture-related information and enhance the texture details; (2) Pyramid Texture Feature Extraction Module (PTFEM), to effectively extract the statistical texture features from multiple scales. Through extensive experiments, we show that the proposed STLNet achieves state-of-the-art performance on three semantic segmentation benchmarks: Cityscapes, PASCAL Context and ADE20K.

研究动机与目标

  • 为解决现有语义分割模型在低级特征中对统计纹理信息利用不足的问题。
  • 提出一种方法,显式地在深度神经网络中建模全局统计纹理分布,以提升分割精度。
  • 通过受直方图均衡化启发的可学习机制,增强低级纹理细节。
  • 通过金字塔结构提取多尺度统计纹理特征,实现鲁棒的特征表示。

提出的方法

  • 引入量化与计数算子(QCO),将连续的纹理分布离散化为量化等级,并统计其频率,实现统计编码。
  • 提出纹理增强模块(TEM),通过在量化等级间传播信息来优化低级特征,模拟直方图均衡化过程。
  • 设计金字塔纹理特征提取模块(PTFEM),利用分层结构捕捉多尺度的统计纹理特征。
  • 将QCO、TEM和PTFEM集成到端到端可训练的网络中,融合低级与高级特征以实现语义分割。
  • 采用标准的编码器-解码器架构并引入跳跃连接,将基于QCO的模块插入多个阶段,以保留并增强纹理细节。
  • 采用标准训练策略,包括数据增强、多尺度推理和翻转操作,以提升泛化能力和性能。

实验结果

研究问题

  • RQ1除了局部结构模式外,统计纹理特征是否能提升语义分割性能?
  • RQ2如何在深度神经网络中有效表示并优化连续的、高维的纹理分布?
  • RQ3通过可学习的、基于直方图的机制增强低级纹理细节,是否能带来更优的边界预测?
  • RQ4多尺度统计纹理特征是否能提升在多样化数据集上的分割鲁棒性与准确性?
  • RQ5所提出的方法是否能以即插即用的方式兼容现有分割架构?

主要发现

  • STLNet在Cityscapes测试集上实现了最先进性能,平均交并比(mIoU)达到82.3%。
  • 在PASCAL Context验证集上,STLNet的mIoU达到55.8%,显著超越此前最先进方法。
  • 在ADE20K验证集上,STLNet的mIoU达到46.48%,展现出在多样化场景类别中的强大泛化能力。
  • 消融实验表明,纹理增强模块(TEM)和金字塔纹理特征提取模块(PTFEM)均对性能提升有显著贡献。
  • 引入多尺度推理和测试时翻转可分别将mIoU提升0.4%和0.2%,两者结合效果最佳。
  • 所提出的模块(TEM和PTFEM)计算开销极低,仅增加17.48 GFLOPs和1.31M参数,使该方法高效且实用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。