[论文解读] Attention Beats Concatenation for Conditioning Neural Fields
本文评估了三种条件机制——拼接、超网络和注意力机制——在神经场中扩展至高维潜在码时的表现。结果表明,注意力机制在重建复杂2D、3D和4D信号方面始终优于拼接和超网络,尤其是在潜在维度增加时,因其能更有效地处理高维表示而不会导致性能下降。
Neural fields model signals by mapping coordinate inputs to sampled values. They are becoming an increasingly important backbone architecture across many fields from vision and graphics to biology and astronomy. In this paper, we explore the differences between common conditioning mechanisms within these networks, an essential ingredient in shifting neural fields from memorization of signals to generalization, where the set of signals lying on a manifold is modelled jointly. In particular, we are interested in the scaling behaviour of these mechanisms to increasingly high-dimensional conditioning variables. As we show in our experiments, high-dimensional conditioning is key to modelling complex data distributions, thus it is important to determine what architecture choices best enable this when working on such problems. To this end, we run experiments modelling 2D, 3D, and 4D signals with neural fields, employing concatenation, hyper-network, and attention-based conditioning strategies -- a necessary but laborious effort that has not been performed in the literature. We find that attention-based conditioning outperforms other approaches in a variety of settings.
研究动机与目标
- 评估并比较常见条件机制(拼接、超网络和注意力)在潜在码维度增加时在神经场中的可扩展性。
- 确定哪种条件策略能更有效地在复杂数据分布中实现泛化,特别是在高维潜在空间中。
- 在多个领域(图像自编码、新视角合成、光场)提供全面且计算密集的基准测试,以指导未来架构设计。
- 确定将非常大的潜在码整合到基于MLP的神经场时,基于拼接的条件机制的最佳架构配置。
- 通过共享约23,000 GPU小时的训练所得的广泛实验结果,降低未来研究成本,避免社区重复计算。
提出的方法
- 采用三种条件机制:(1) 将潜在码直接拼接到输入层,(2) 超网络通过潜在码生成网络权重,(3) 自注意力机制对潜在表示进行注意力计算。
- 在三种信号类型上应用这些方法:2D图像自编码(CelebA-HQ)、3D辐射场(NeRF)和4D光场(基于NeRF),使用标准基准数据集。
- 对于拼接方法,通过消融研究分析将潜在码拆分为多个子向量并在MLP的不同层注入,以缓解维度瓶颈问题。
- 采用固定的8层网络深度,并施加宽度约束(如256个隐藏单元),以在共享计算预算下确保方法间的公平比较。
- 以PSNR作为重建质量的主要指标,测量在潜在码维度高达8192时的性能表现。
- 在超网络中平衡超参数选择,以确保实例级与样本级计算的计算成本相当,从而实现公平比较。
实验结果
研究问题
- RQ1随着潜在码维度的增加,基于拼接的条件机制性能如何退化?
- RQ2与拼接相比,超网络和基于注意力的条件机制在重建质量和向高维潜在空间扩展方面的表现如何?
- RQ3将非常大的潜在码整合到MLP-based神经场时,最优的架构配置是什么?
- RQ4基于注意力的条件机制是否在多种信号类型(2D、3D、4D)和高维潜在码中均保持优越性能?
- RQ5本大规模实验的发现是否能减少未来研究者重复进行昂贵消融研究的需求?
主要发现
- 基于注意力的条件机制在所有评估设置中均达到最高的PSNR,尤其在潜在码维度超过2048时表现尤为突出。
- 对于拼接方法,将潜在码拆分为8个子向量并在MLP的不同层注入时性能最佳,在8192维潜在码下CelebA-HQ的PSNR达到24.46。
- 仅在单一层输入注入且不拆分潜在码的拼接方法,PSNR仅为20.53,表明高维输入下性能严重退化。
- 超网络表现出有竞争力的性能,但在高维场景下仍逊于基于注意力的方法。
- 消融研究证实,输入瓶颈处的维度压缩是标准拼接方法的关键限制,而拆分策略可有效缓解该问题。
- 结果表明,注意力机制在建模复杂、高熵数据分布时,相比拼接或超网络具有更优的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。