Skip to main content
QUICK REVIEW

[論文レビュー] MINER: Multiscale Implicit Neural Representations

Vishwanath Saragadam, Jasper Tan|arXiv (Cornell University)|Feb 7, 2022
Model Reduction and Neural Networks被引用数 8
ひとこと要約

MINERは、ラプラシアンピラミッドを用いて信号をスケールごとのスパースで直交する成分に分解するマルチスケール暗黙的ニューラル表現を導入する。各スケールで不重複なパッチに局在的な小さなMLPを訓練することで(粗いスケールから細かいスケールへ)、ACORNと比較して10倍速い学習、25%未満のパラメータ数、10%の計算時間で、ギガピクセル画像および10億点の3D点群においても高い精度を維持する。

ABSTRACT

We introduce a new neural signal model designed for efficient high-resolution representation of large-scale signals. The key innovation in our multiscale implicit neural representation (MINER) is an internal representation via a Laplacian pyramid, which provides a sparse multiscale decomposition of the signal that captures orthogonal parts of the signal across scales. We leverage the advantages of the Laplacian pyramid by representing small disjoint patches of the pyramid at each scale with a small MLP. This enables the capacity of the network to adaptively increase from coarse to fine scales, and only represent parts of the signal with strong signal energy. The parameters of each MLP are optimized from coarse-to-fine scale which results in faster approximations at coarser scales, thereby ultimately an extremely fast training process. We apply MINER to a range of large-scale signal representation tasks, including gigapixel images and very large point clouds, and demonstrate that it requires fewer than 25% of the parameters, 33% of the memory footprint, and 10% of the computation time of competing techniques such as ACORN to reach the same representation accuracy.

研究の動機と目的

  • 大規模な信号における単一の大規模MLPの高い計算コストとメモリ使用量を解消する。
  • 視覚的信号におけるスケール間の自己類似性を活用して、効率的で階層的な表現を実現する。
  • ギガピクセル画像および3D点群において、高い表現精度を維持しながら、学習時間とモデルの複雑さを低減する。
  • 3Dボリュームや高解像度画像などの極めて高次元の信号におけるニューラル暗黙的表現の実用的導入を可能にする。
  • マルチスケール分解とブロック単位のプルーニング、段階的学習を組み合わせることで、コンactでメモリ効率的かつ高速な学習を達成する。

提案手法

  • 入力信号をラプラシアンピラミッドに分解して、空間スケールにわたるマルチスケールで直交する信号成分を取得する。
  • 各スケールを、固定サイズの不重複な画像またはボリュームパッチ上で訓練された多数の小さな局所的MLPで表現する。
  • ラプラシアンピラミッド成分の近似的な直交性を活用して、粗いスケールから細かいスケールへ段階的に学習を進める。
  • 学習前にプルーニング戦略を適用する:分散が低い(信号エネルギーがほぼゼロに近い)ブロックは除外され、細かいスケールでの有効なMLP数が削減される。
  • 各ブロックの平均二乗誤差(MSE)の閾値($10^{-4}$)を用いて、ブロックを学習に含めるかどうかを決定し、計算効率を確保する。
  • ラプラシアンピラミッドの階層構造とブロックベース表現を活用して、ストリーミング再構成とLOD(詳細度)レンダリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1ラプラシアンピラミッドを用いたマルチスケールニューラル表現は、単一スケールの暗黙的ネットワークよりも、高速な学習と低いメモリ使用量を達成できるか?
  • RQ2スパースな信号成分上で局所的MLPを粗いスケールから細いスケールへ段階的に学習させることで、収束速度と表現精度にどのような影響を与えるか?
  • RQ3信号分散に基づくブロックプルーニングによって、再構成品質を損なわずにパラメータ数と計算量をどの程度削減できるか?
  • RQ4提案手法は、ギガピクセル画像および10億点の3D点群に対して、ACORNのような最先端技術を上回る性能で効率的にスケーリング可能か?
  • RQ5MINERの階層的でマルチスケール構造は、リアルタイムレンダリングやメッシュ圧縮などの実用的応用をサポートできるか?

主な発見

  • MINERは3Dタイ像点群において6分未満で0.999のIoUを達成したが、ACORNでは53分、同程度の精度に到達するには7時間以上を要した。
  • 最も細かいスケールで、MINERは990万パラメータと37.9MBのディスク領域を必要としたのに対し、ACORNは1700万パラメータと68MBを要し、パラメータ数で42%、ディスクサイズで45%の削減が達成された。
  • 同じ学習時間(6分)において、MINERはACORNの10倍速く収束し、0.99のIoUを達成した。一方ACORNはその時間で0.97のIoUにとどまった。
  • MINERは3時間未満でギガピクセル画像を38dB以上のPSNRで再構成したが、ACORNでは1日以上を要した。これは学習速度が10倍速いことを示している。
  • MINERの最も粗いスケール(スケール3)は、90万パラメータと3.5MBのディスク領域で17秒で0.95のIoUを達成し、高速でリソースをほとんど使わない初期近似が可能になった。
  • MINERは標準のPLYメッシュファイル(180MB)の3分の1未満のディスク領域(3.5MB)で収まるため、効果的なメッシュ圧縮が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。