Skip to main content
QUICK REVIEW

[论文解读] Geometric Scene Parsing with Hierarchical LSTM

Zhanglin Peng, Ruimao Zhang|arXiv (Cornell University)|Apr 7, 2016
Advanced Image and Video Retrieval Techniques参考文献 23被引用 10
一句话总结

本文提出分层长短期记忆网络(H-LSTM),一种递归神经网络,通过联合预测像素级表面标签(如天空、地面)和区域之间的交互关系(如支撑、贴合),实现几何场景解析。该模型采用耦合的像素LSTM捕捉局部空间上下文,利用多尺度超像素LSTM实现分层全局推理,在SIFT-Flow和LM+SUN数据集上达到最先进性能,并实现了从单张图像的高精度三维重建。

ABSTRACT

This paper addresses the problem of geometric scene parsing, i.e. simultaneously labeling geometric surfaces (e.g. sky, ground and vertical plane) and determining the interaction relations (e.g. layering, supporting, siding and affinity) between main regions. This problem is more challenging than the traditional semantic scene labeling, as recovering geometric structures necessarily requires the rich and diverse contextual information. To achieve these goals, we propose a novel recurrent neural network model, named Hierarchical Long Short-Term Memory (H-LSTM). It contains two coupled sub-networks: the Pixel LSTM (P-LSTM) and the Multi-scale Super-pixel LSTM (MS-LSTM) for handling the surface labeling and relation prediction, respectively. The two sub-networks provide complementary information to each other to exploit hierarchical scene contexts, and they are jointly optimized for boosting the performance. Our extensive experiments show that our model is capable of parsing scene geometric structures and outperforming several state-of-the-art methods by large margins. In addition, we show promising 3D reconstruction results from the still images based on the geometric parsing.

研究动机与目标

  • 解决几何场景解析的挑战,即需要同时预测区域的表面标签与区域间的交互关系。
  • 通过引入丰富且多尺度的上下文信息,克服传统语义分割的局限,实现对几何结构的鲁棒理解。
  • 构建统一的深度学习框架,利用分层递归网络联合优化表面标签预测与关系预测。
  • 通过利用几何解析输出作为结构先验,实现从单视角图像的高精度三维重建。
  • 验证多任务学习与分层特征表示在建模复杂场景结构中的有效性。

提出的方法

  • 使用共享的卷积主干网络提取初始图像特征,随后将其输入至两个并行子网络:像素LSTM(P-LSTM)与多尺度超像素LSTM(MS-LSTM)。
  • 利用P-LSTM通过按像素顺序处理特征,建模局部空间依赖性,提升细粒度的表面标签预测性能。
  • 在多尺度超像素表示(16, 32, 48, 64, 128)上应用MS-LSTM,以捕获用于交互关系预测的分层上下文信息。
  • 通过在每个MS-LSTM层后输出关系预测结果,实现深度监督,以提升特征学习与模型优化效果。
  • 端到端联合训练两个子网络,使P-LSTM与MS-LSTM通过共享梯度相互受益,并利用互补的上下文信息。
  • 利用长短期记忆单元,选择性地保留并传播不同空间抽象层级之间的长程依赖关系。

实验结果

研究问题

  • RQ1递归神经网络能否有效建模几何场景解析中的局部与全局场景上下文?
  • RQ2与独立训练相比,联合优化表面标签预测与交互关系预测是否能提升整体性能?
  • RQ3相较于单尺度或像素级建模,多尺度超像素表示在多大程度上提升了关系预测性能?
  • RQ4所提出的H-LSTM框架是否能够仅依赖几何解析输出,实现从单张图像的高精度三维重建?
  • RQ5H-LSTM的分层结构相较于标准卷积网络或单尺度LSTM架构,在捕捉场景几何结构方面表现如何?

主要发现

  • H-LSTM模型在SIFT-Flow数据集上达到95.41%的像素级准确率,在LM+SUN数据集上达到91.34%,优于所有消融实验变体。
  • 采用五层MS-LSTM与多尺度超像素图时,在SIFT-Flow数据集上关系预测的平均精确率达到91.2%,在LM+SUN上为95.8%,在G-Context上为90.8%。
  • 消融实验表明,将P-LSTM替换为五层卷积网络后,SIFT-Flow数据集上的像素准确率下降至94.66%,证明递归建模在捕捉长程依赖关系方面更具优势。
  • 移除多任务学习(即仅训练P-LSTM而不使用MS-LSTM)导致性能显著下降,证实两项任务之间存在相互促进关系。
  • 使用单尺度超像素(S-LSTM)的性能低于多尺度H-LSTM,证明了分层特征学习的优势。
  • 模型能够实现高质量的单图三维重建,定性结果表明重建的三维场景结构具有一致性与合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。