[论文解读] 3D Gated Recurrent Fusion for Semantic Scene Completion
本文提出GRFNet,一种用于语义场景补全的3D门控循环融合网络,通过门控机制实现RGB与深度特征的自适应融合,并利用记忆单元保留互补信息。该方法在NYU和NYUCAD数据集上取得最先进性能,NYU数据集上mIoU达到32.9%,较基于LSTM的融合方法提升2.7%。
This paper tackles the problem of data fusion in the semantic scene completion (SSC) task, which can simultaneously deal with semantic labeling and scene completion. RGB images contain texture details of the object(s) which are vital for semantic scene understanding. Meanwhile, depth images capture geometric clues of high relevance for shape completion. Using both RGB and depth images can further boost the accuracy of SSC over employing one modality in isolation. We propose a 3D gated recurrent fusion network (GRFNet), which learns to adaptively select and fuse the relevant information from depth and RGB by making use of the gate and memory modules. Based on the single-stage fusion, we further propose a multi-stage fusion strategy, which could model the correlations among different stages within the network. Extensive experiments on two benchmark datasets demonstrate the superior performance and the effectiveness of the proposed GRFNet for data fusion in SSC. Code will be made available.
研究动机与目标
- 为解决语义场景补全(SSC)中RGB与深度模态融合的挑战,其中每种模态提供互补但冗余的信息。
- 开发一种可学习的、自适应的融合机制,选择性地结合RGB与深度特征中的相关部分,同时保留缺失或模糊的细节。
- 通过多阶段融合策略,利用低级与高级特征,提升SSC性能。
- 通过引入循环门控架构,超越现有融合方法(如加法、最大值、拼接和双线性融合)
提出的方法
- GRFNet采用一种受门控循环单元(GRUs)启发的新型门控循环融合(GRF)模块,利用门控机制自适应选择来自RGB和深度输入的重要特征。
- GRF模块包含一个记忆组件,可在模态特征间保留并传播互补信息,提升对遮挡和缺失数据的鲁棒性。
- 单阶段GRFNet使用GRF模块在单个网络阶段融合特征,而多阶段GRFNet则在编码器-解码器的多个阶段级联GRF模块,以结合低级与高级特征。
- 多阶段融合策略按顺序处理来自不同网络阶段的特征,使网络能够逐步优化融合表示。
- GRF模块使用3D卷积实现,作用于对齐的RGB-D体素网格,支持模态融合的端到端学习。
- 框架通过交叉熵损失和交并比(IoU)损失进行端到端训练,用于语义标注与场景补全。
实验结果
研究问题
- RQ1可学习的循环融合机制是否能在RGB-深度特征融合中超越人工设计的融合操作(如加法、最大值或拼接)?
- RQ2在融合模块中引入记忆机制是否能通过保留模态间的互补信息来提升性能?
- RQ3结合不同网络深度特征的多阶段融合是否能优于单阶段融合,从而提升SSC精度?
- RQ4在基准数据集上,所提出的GRFNet与现有最先进方法相比,mIoU和IoU表现如何?
主要发现
- GRFNet在NYU数据集上达到32.9%的mIoU,优于基线DDR-SSC及现有融合方法。
- GRF融合模块在NYU和NYUCAD数据集上分别较LSTM融合方法提升2.7%和3.4%的mIoU,且参数量更少。
- 多阶段GRFNet在场景补全上的平均IoU高出DDR-SSC 0.2%,在语义场景补全上高出2.5%。
- 消融实验表明,门控机制显著优于非门控融合,且记忆组件进一步提升了精度。
- GRFNet在mIoU上较加法、最大值和拼接融合方法高出2.5–3.5个百分点,证明了自适应门控融合的优越性。
- 尽管融合阶段增多导致FLOPs上升,但由于GRF模块的复用,参数增长极小,表明模型扩展具有良好的效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。