Skip to main content
QUICK REVIEW

[論文レビュー] Neural 3D Scene Compression via Model Compression

Berivan Isik|arXiv (Cornell University)|May 7, 2021
Advanced Vision and Imaging参考文献 40被引用数 8
ひとこと要約

本稿では、神経放射場(NeRF)をニューラルネットワークのモデルプルーニングにより圧縮することで、冗長な2D画像の保存を不要にする、新しい3次元シーン圧縮手法を提案する。最大90%のNeRFパラメータをプルーニングし、再訓練することで、最大10倍の圧縮が達成され、視認的品質の損失は最小限に抑えられ、特に30%のプルーニングではPSNRがわずかに向上し、アーティファクトはほとんど見られない。

ABSTRACT

Rendering 3D scenes requires access to arbitrary viewpoints from the scene. Storage of such a 3D scene can be done in two ways; (1) storing 2D images taken from the 3D scene that can reconstruct the scene back through interpolations, or (2) storing a representation of the 3D scene itself that already encodes views from all directions. So far, traditional 3D compression methods have focused on the first type of storage and compressed the original 2D images with image compression techniques. With this approach, the user first decodes the stored 2D images and then renders the 3D scene. However, this separated procedure is inefficient since a large amount of 2D images have to be stored. In this work, we take a different approach and compress a functional representation of 3D scenes. In particular, we introduce a method to compress 3D scenes by compressing the neural networks that represent the scenes as neural radiance fields. Our method provides more efficient storage of 3D scenes since it does not store 2D images -- which are redundant when we render the scene from the neural functional representation.

研究の動機と目的

  • 3次元シーン再構築に大量の2D画像を保存する従来の3次元圧縮手法の非効率性を解消すること。
  • 画像ベースの保存とは対照的に、機能的3次元シーン表現(特にNeRF)を、より効率的な代替手段として探求すること。
  • Neuralネットワーク圧縮技術、特にプルーニングをNeRFモデルに直接適用することで、3次元シーン圧縮を改善すること。
  • NeRFに基づく3次元シーン表現における、圧縮比、モデルサイズ、レンダリング品質のトレードオフを評価すること。

提案手法

  • 本手法は、事前に訓練済みのNeRFモデルの全結合層をプルーニングすることで3次元シーンを圧縮し、初期段階では再訓練を行わず、モデルパラメータを削減する。
  • プルーニング後、アーティファクトを軽減するために再訓練(ファインチューニング)を実施し、レンダリング品質を回復・向上させる。
  • 本手法は、NeRFの機能的性質を活用しており、空間座標と視線方向の5次元関数として連続的な色と密度を出力するため、関数的表現そのものを直接圧縮可能である。
  • 圧縮比は、元のモデルサイズとプルーニング後のモデルサイズの比として測定され、90%のプルーニングで最大10倍の圧縮が達成された。
  • レンダリング品質は、合成データセット(fern および lego)を用いてPSNRおよびMSE指標で評価され、元のモデル、プルーニング済みモデル、再訓練済みモデルを比較した。
  • レンダリングされたビュー、深度マップ、メッシュ再構築の視覚的および定量的分析により、知覚的・構造的忠実度を評価した。

実験結果

リサーチクエスチョン

  • RQ1NeRFのモデルプルーニングは、3次元シーンレンダリング品質に顕著な劣化を来すことなく、顕著な圧縮を達成できるか?
  • RQ2プルーニング後の再訓練は、圧縮されたNeRFベースの3次元シーンの視覚的・定量的忠実度にどのように影響するか?
  • RQ3NeRFベースの3次元シーン表現における、圧縮比と知覚的品質のトレードオフは何か?
  • RQ4プルーニングは幾何学的および色のアーティファクトを引き起こすか?また、再訓練はそれらを効果的に軽減できるか?
  • RQ5NeRFのような機能的3次元表現は、プルーニングなどのニューラルネットワーク圧縮技術を用いて効果的に圧縮可能か?

主な発見

  • 30%のプルーニングでは、fernデータセットでPSNRが25.41、legoデータセットで29.14を達成し、品質劣化は最小限であり、元のモデルよりもわずかにPSNRが向上した。
  • 再訓練後、30%プルーニングモデルは高い忠実度を維持し、PSNRはfernで25.45、legoで30.43を記録し、アーティファクトの回復が有効に達成された。
  • 50%のプルーニングでは、PSNRはfernで22.48、legoで25.32に低下し、幾何学的および色のアーティファクトが顕著に現れたが、再訓練により品質が顕著に向上した。
  • 70%のプルーニングでは、PSNRはfernで20.97、legoで21.70に低下し、メッシュおよび深度マップの品質に顕著な劣化が見られたが、再訓練により欠損部分が回復した。
  • 90%のプルーニングでは、PSNRはfernで16.87、legoで15.99に低下し、品質損失が顕著に現れたが、再訓練により空洞部分が埋められ、再構築が改善された。
  • 本手法は最大10倍の圧縮比(90%プルーニング時)を達成し、MSE値はfernで0.0706、legoで0.0786を記録し、品質の妥協を伴いながらも、高いストレージ効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。