[論文レビュー] Deep Implicit Volume Compression
本稿では、4次元ボリュメトリックデータにおける切り捨てられた符号付き距離関数(TSDF)および関連するテクスチャの深層学習ベースの圧縮フレームワークを提案する。エンド・トゥ・エンドで学習可能なブロックベースのニューラルネットワークに、エントロピー符号化と損失なし符号圧縮を組み合わせた。最先端の手法と比較して、66%のビットレート削減、または50%の歪み削減を達成し、空間的・時間的整合性を持つテクスチャパラメータ化により、幾何学的およびテクスチャ的忠実度が向上している。
We describe a novel approach for compressing truncated signed distance fields (TSDF) stored in 3D voxel grids, and their corresponding textures. To compress the TSDF, our method relies on a block-based neural network architecture trained end-to-end, achieving state-of-the-art rate-distortion trade-off. To prevent topological errors, we losslessly compress the signs of the TSDF, which also upper bounds the reconstruction error by the voxel size. To compress the corresponding texture, we designed a fast block-based UV parameterization, generating coherent texture maps that can be effectively compressed using existing video compression algorithms. We demonstrate the performance of our algorithms on two 4D performance capture datasets, reducing bitrate by 66% for the same distortion, or alternatively reducing the distortion by 50% for the same bitrate, compared to the state-of-the-art.
研究の動機と目的
- AR/VRおよびフリービューポイント動画応用における4次元ボリュメトリック再構築の高いメモリ使用量を低減すること。
- Tangら[59] や Draco といった既存手法を上回る、圧縮されたTSDFボリュームのレート歪み性能を向上させること。
- ボクセルサイズに依存する再構築誤差を制限し、トポロジーを保持するために、TSDF符号の損失なし圧縮を可能にすること。
- UV座標の圧縮なしに、空間的・時間的整合性を保証するテクスチャパラメータ化手法を設計すること。
- 4次元パフォーマンスキャプチャのため、幾何学的およびテクスチャ的圧縮を統合的かつエンド・トゥ・エンドで学習可能なシステムに統合すること。
提案手法
- 学習可能なエントロピーモデリングを備えたブロックベース3次元畳み込みオートエンコーダーを用いて、TSDFボリュームのエンド・トゥ・エンド圧縮を実現。
- 再構築誤差がボクセルサイズによって制限されるように、TSDF符号の損失なし圧縮に条件付き事前分布 $ p_{\mathbf{s}|\hat{\mathbf{z}}} $ を採用。
- モートンパックドチャートを用いた新規なブロックベースUVパラメータ化を導入し、テクスチャマップにおける空間的・時間的整合性を向上。
- 標準の動画コーデック(例:H.264)を整合性のあるテクスチャマップに適用し、別個のUV座標圧縮を回避。
- 等値面付近の誤差に重点を置いた、表面に配慮した歪み損失を用いてネットワークを訓練。
- エンコーダーが出力する量子化コード $ \hat{\mathbf{z}} $ を統合的に処理するパイプラインを採用し、デコーダーは $ \hat{\mathbf{x}} = \mathbf{s} \odot |\mathcal{D}(\hat{\mathbf{z}})| $ として再構築。
実験結果
リサーチクエスチョン
- RQ1学習可能なエンド・トゥ・エンド圧縮モデルは、既存手法と比較して4次元TSDFデータにおける優れたレート歪み性能を達成できるか?
- RQ2TSDF符号の損失なし圧縮は、再構築誤差とトポロジー的忠実度にどのように影響するか?
- RQ3モートンパッキングを用いたブロックベーステクスチャパラメータ化は、トラッキングやUV座標送信なしに圧縮効率を向上させられるか?
- RQ4標準の動画コーデックを用いた場合、テクスチャマップの空間的・時間的整合性がビットレート削減にどの程度寄与するか?
- RQ5幾何学的およびテクスチャ的圧縮を1つのパイプラインに統合することで、個別処理よりも優れた全体的な性能が得られるか?
主な発見
- Tang ら[59] の最先端手法と比較して、同じ歪みレベルで66%のビットレート削減を達成した。
- 同じビットレートで、Tang ら[59] と比較して歪みを50%削減した。これは、優れたレート歪み性能を示している。
- TSDF符号の損失なし圧縮により、再構築誤差がボクセルサイズによって制限され、再構築表面のトポロジー的正しさが保証された。
- 提案されたテクスチャパラメータ化は、平均1ボリュームあたり350 KBのレートでPSNR 30.9を達成し、UVAtlas[71] やナード・ビンパッキングベースラインを上回る圧縮効率を示した。
- 低ビットレートでもレンダリングされたテクスチャに目立つアーチファクトがなく、視覚的品質が高く保たれている。定性的な比較で明確に示された。
- 単一GPU上で20msのエンド・トゥ・エンド推論時間を達成し、リアルタイム応用における実用的効率性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。