[论文解读] MINER: Multiscale Implicit Neural Representations
MINER 通过使用拉普拉斯金字塔将信号分解为跨尺度的稀疏正交分量,引入了一种多尺度隐式神经表示。通过从粗到细逐级在不相交的补丁上训练小型局部 MLP,实现了 10 倍于 ACORN 的训练速度、参数量低于 25%,计算时间减少 10%,同时在吉像素图像和十亿点 3D 点云上保持了高精度。
We introduce a new neural signal model designed for efficient high-resolution representation of large-scale signals. The key innovation in our multiscale implicit neural representation (MINER) is an internal representation via a Laplacian pyramid, which provides a sparse multiscale decomposition of the signal that captures orthogonal parts of the signal across scales. We leverage the advantages of the Laplacian pyramid by representing small disjoint patches of the pyramid at each scale with a small MLP. This enables the capacity of the network to adaptively increase from coarse to fine scales, and only represent parts of the signal with strong signal energy. The parameters of each MLP are optimized from coarse-to-fine scale which results in faster approximations at coarser scales, thereby ultimately an extremely fast training process. We apply MINER to a range of large-scale signal representation tasks, including gigapixel images and very large point clouds, and demonstrate that it requires fewer than 25% of the parameters, 33% of the memory footprint, and 10% of the computation time of competing techniques such as ACORN to reach the same representation accuracy.
研究动机与目标
- 解决单个大型 MLP 在大规模信号神经隐式表示中的高计算成本和内存占用问题。
- 利用视觉信号在尺度间的自相似性,实现高效分层表示。
- 在保持吉像素图像和 3D 点云高表示精度的前提下,减少训练时间和模型复杂度。
- 实现在极高维信号(如 3D 体素和高分辨率图像)上神经隐式表示的实际部署。
- 通过结合多尺度分解与分块剪枝及渐进式训练,实现紧凑、内存高效且快速的训练。
提出的方法
- 将输入信号分解为拉普拉斯金字塔,以获得跨空间尺度的多尺度、正交信号分量。
- 使用多个小型局部 MLP 表示每个尺度,这些 MLP 在固定大小的不相交图像或体积分块上进行训练。
- 从最粗到最细尺度逐步训练 MLP,利用拉普拉斯金字塔分量的近似正交性实现迭代优化。
- 在训练前应用剪枝策略:信号能量接近零(方差低)的块被排除,从而减少细尺度下的活跃 MLP 数量。
- 使用每块的均方误差(MSE)阈值($10^{-4}$)判断是否将某一块纳入训练,确保计算效率。
- 通过利用拉普拉斯金字塔的分层结构与基于分块的表示,支持流式重建和细节层次渲染。
实验结果
研究问题
- RQ1使用拉普拉斯金字塔的多尺度神经表示能否在训练速度和内存占用上优于单尺度隐式网络?
- RQ2在稀疏信号分量上对局部 MLP 采用从粗到细的渐进式训练,如何影响收敛速度与表示精度?
- RQ3基于信号方差的分块剪枝在不牺牲重建质量的前提下,能在多大程度上减少参数量与计算量?
- RQ4所提方法能否在吉像素图像和十亿点 3D 点云上高效扩展,并优于 ACORN 等最先进方法?
- RQ5MINER 的分层多尺度结构是否支持实际应用,如实时渲染或网格压缩?
主要发现
- MINER 在 6 分钟内完成 3D 泰国雕像点云的 IoU 达 0.999,而 ACORN 需 53 分钟,且需 7 小时以上才能达到类似精度。
- 在最细尺度下,MINER 仅使用 990 万参数和 37.9MB 磁盘空间,而 ACORN 需 1700 万参数和 68MB,分别减少 42% 参数量与 45% 磁盘占用。
- 在相同训练时间(6 分钟)下,MINER 实现 0.99 IoU,收敛速度比 ACORN 快 10 倍,后者仅达 0.97 IoU。
- MINER 在三小时内完成吉像素图像表示,PSNR 超过 38dB,而 ACORN 需超过一天,训练速度提升 10 倍。
- MINER 最粗尺度(第 3 级)在 17 秒内实现 0.95 IoU,仅使用 90 万参数和 3.5MB 磁盘空间,支持快速、低资源的初始近似。
- MINER 所占磁盘空间不足标准 PLY 网格文件(3.5MB vs. 180MB)的三分之一,实现了高效的网格压缩。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。