Skip to main content
QUICK REVIEW

[论文解读] HoHoNet: 360 Indoor Holistic Understanding with Latent Horizontal Features

Cheng Sun, Min Sun|arXiv (Cornell University)|Nov 23, 2020
Advanced Vision and Imaging参考文献 33被引用 7
一句话总结

HoHoNet 是一种快速且准确的深度学习框架,用于整体360°室内场景理解,通过使用潜在水平特征(LHFeat)压缩垂直空间信息,同时借助一种新颖的水平到密集(h2d)模块实现在像素级别的密集预测。在高分辨率 $512\times1024$ 全景图上,使用ResNet-50时达到52 FPS,使用ResNet-34时达到110 FPS,其在密集深度估计方面优于先前方法,并在布局和语义分割任务中达到最先进性能。

ABSTRACT

We present HoHoNet, a versatile and efficient framework for holistic understanding of an indoor 360-degree panorama using a Latent Horizontal Feature (LHFeat). The compact LHFeat flattens the features along the vertical direction and has shown success in modeling per-column modality for room layout reconstruction. HoHoNet advances in two important aspects. First, the deep architecture is redesigned to run faster with improved accuracy. Second, we propose a novel horizon-to-dense module, which relaxes the per-column output shape constraint, allowing per-pixel dense prediction from LHFeat. HoHoNet is fast: It runs at 52 FPS and 110 FPS with ResNet-50 and ResNet-34 backbones respectively, for modeling dense modalities from a high-resolution $512 imes 1024$ panorama. HoHoNet is also accurate. On the tasks of layout estimation and semantic segmentation, HoHoNet achieves results on par with current state-of-the-art. On dense depth estimation, HoHoNet outperforms all the prior arts by a large margin.

研究动机与目标

  • 实现对360°室内全景图的高效且高精度的整体理解,涵盖多项任务。
  • 解决先前方法仅限于逐列输出的局限性,通过从紧凑的LHFeat实现逐像素的密集预测。
  • 在不牺牲布局估计、语义分割和深度估计性能的前提下,提升推理速度。
  • 开发一个统一的框架,使用单一紧凑的特征表示支持多种模态——布局、深度和语义。

提出的方法

  • 该框架使用CNN主干网络(如ResNet-50/34)从等距投影全景图中提取多尺度特征。
  • 高效的垂直压缩(EHC)模块将特征金字塔的垂直维度压缩为紧凑的潜在水平特征(LHFeat),在降低空间分辨率的同时保留结构信息。
  • 新颖的水平到密集(h2d)模块通过在频域中利用离散余弦变换(DCT)建模行相关性,从LHFeat重建密集2D预测。
  • h2d模块用逆DCT替代线性插值,以更好地保留空间细节并提升密集预测质量。
  • 在EHC模块中应用多头自注意力(MHSA)以优化压缩后的特征。
  • 通过在LHFeat上应用1D卷积层生成最终预测,用于布局、深度和语义分割等任务。

实验结果

研究问题

  • RQ1紧凑的潜在特征表示能否在360°室内场景理解中同时支持逐列和逐像素的密集预测?
  • RQ2如何优化全景特征的垂直压缩,以保留与重力对齐的结构规律性?
  • RQ3与压缩特征空间中的标准插值相比,通过DCT进行频域建模能否提升密集预测质量?
  • RQ4所提出的框架在速度和精度方面相较于最先进方法在多项360°场景理解任务中的表现如何?
  • RQ5统一的网络架构能否在布局估计、语义分割和密集深度估计中均实现具有竞争力的性能?

主要发现

  • HoHoNet 在 $512\times1024$ 全景图上使用ResNet-50时达到52 FPS,使用ResNet-34时达到110 FPS,使其在实时应用中极为高效。
  • 在密集深度估计方面,HoHoNet 超过所有先前方法,在Stanford2D3D的高分辨率RGB-D输入上实现43.3 MAE,优于次佳方法的43.3 MAE。
  • 在语义分割方面,HoHoNet 在高分辨率RGB-D输入上实现66.5%的mIoU,超过TangentImg的61.4%,并达到最佳报告性能。
  • 在布局估计方面,HoHoNet 总体3D IoU为80.02%,2D IoU为82.32%,优于HorizonNet,与AtlantaNet相当,但速度快22倍。
  • h2d模块能够从LHFeat实现高质量的密集预测,表明通过IDCT进行频域重建优于线性插值。
  • 该框架具有高度通用性,使用单一紧凑特征表示即可支持布局、深度和语义分割,实现统一且高效的推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。