[論文レビュー] HDR-NeRF: High Dynamic Range Neural Radiance Fields
HDR-NeRFは、露出が異なる複数枚の低ダイナミックレンジ(LDR)画像から、高ダイナミックレンジ(HDR)ニューラルレイトランスフィールドをエンドツーエンドで回復する手法を提案する。カメラ応答関数(CRF)を微分可能トーンマッピングでモデル化し、LDRの教師信号のみを用いてレイトランスフィールドとトーンマッピングを同時に最適化することで、HDRの新規ビュー合成と任意の露出設定での制御可能なLDRビューレンダリングを可能にし、新規に作成した合成および実世界のHDRデータセットにおいて最先端の性能を達成した。
We present High Dynamic Range Neural Radiance Fields (HDR-NeRF) to recover an HDR radiance field from a set of low dynamic range (LDR) views with different exposures. Using the HDR-NeRF, we are able to generate both novel HDR views and novel LDR views under different exposures. The key to our method is to model the physical imaging process, which dictates that the radiance of a scene point transforms to a pixel value in the LDR image with two implicit functions: a radiance field and a tone mapper. The radiance field encodes the scene radiance (values vary from 0 to +infty), which outputs the density and radiance of a ray by giving corresponding ray origin and ray direction. The tone mapper models the mapping process that a ray hitting on the camera sensor becomes a pixel value. The color of the ray is predicted by feeding the radiance and the corresponding exposure time into the tone mapper. We use the classic volume rendering technique to project the output radiance, colors, and densities into HDR and LDR images, while only the input LDR images are used as the supervision. We collect a new forward-facing HDR dataset to evaluate the proposed method. Experimental results on synthetic and real-world scenes validate that our method can not only accurately control the exposures of synthesized views but also render views with a high dynamic range.
研究の動機と目的
- 既存のNeRF手法が、現実のシーンがもつよりもはるかに高いダイナミックレンジを持つにもかかわらず、常に低ダイナミックレンジ(LDR)の新規ビューしか生成できないという制限に対処すること。
- HDRの教師画像を必要とせず、露出が異なる複数枚のLDR画像から、エンドツーエンドで高ダイナミックレンジ(HDR)レイトランスフィールドを学習すること。
- シーンの放射輝度からピクセル値へのマッピングを微分可能トーンマッピング関数としてモデル化し、合成されたビューにおける露出の制御を可能にすること。
- 合成および実世界のシーンを含む新しい前方視線HDRデータセットを収集・公開し、HDRビュー合成のベンチマークを提供すること。
提案手法
- 本手法は、シーンを2つの連続的な暗黙的ニューラル関数でモデル化する:放射輝度(0〜∞の無限大の範囲)を出力するレイトランスフィールドと、放射輝度と露出時間を入力としてピクセル値へマップするトーンマッパー。
- トーンマッパーは、カメラ応答関数(CRF)を学習する多層パーセプトロン(MLP)として実装され、シーンの放射輝度からLDRピクセル値への微分可能なマッピングを可能にする。
- ボリュームレンダリングを用いて、光線に沿った放射輝度と色を統合し、HDRおよびLDR画像を生成する。教師信号にはLDRの真値のみが使用される。
- RGBチャネル全体にわたるCRF推定の正則化を図るため、ユニット露出損失(L_u)を導入し、色収差の低減と色の一貫性の向上を実現する。
- 複数の露出時間を持つLDR入力から高精度なHDR再構成を可能にするために、マルチ露出損失を用いてレイトランスフィールドとトーンマッパーを同時に最適化する。
- HDRの教師信号を一切必要とせず、LDR画像のみを用いてエンドツーエンドで学習し、任意の露出設定での新規ビューの推論を可能にする。
実験結果
リサーチクエスチョン
- RQ1露出が異なる複数枚のLDR画像から、HDRの教師画像なしでエンドツーエンドに学習可能なニューラルレイトランスフィールドを構築し、高ダイナミックレンジ(HDR)の新規ビューを生成できるか?
- RQ2NeRFフレームワーク内に、微分可能コンponentとしてカメラ応答関数(CRF)を効果的にモデル化することで、新規LDRビューにおける露出の制御を可能にできるか?
- RQ3自己教師付き設定下で、入力露出枚数の増加が、再構成されたHDRおよびLDRビューの品質に与える影響は何か?
- RQ4共同最適化されたレイトランスフィールドとトーンマッパーは、LDRの教師信号のみを用いても、真値HDR画像と視覚的および定量的に類似したHDR結果を生成できるか?
- RQ5RGBチャネルごとに独立してCRFをモデル化することで、複雑な色応答を示す実世界のシーンにおける性能にどのような影響を与えるか?
主な発見
- 3枚以上の露出を使用した場合、合成シーンではPSNRが37.60、SSIMが0.963、LPIPSが0.021に達し、NeRF-GTの性能に非常に近い結果を達成した。
- 2枚の露出のみを使用した場合、性能が著しく低下(PSNRが32.39に低下)し、高品質なHDR再構成には少なくとも3枚の露出が必要であることが示された。
- ユニット露出損失(L_u)の導入により、HDRビュー品質が著しく向上し、LPIPSは0.163から0.021に低下し、レンダリング画像における色収差が完全に解消された。
- 本手法は、過剰露出および不足露出領域の詳細を露わにするトーンマップHDRビューを生成し、ヒストограмの分布が真値と密接に一致した。
- アブレーションスタディの結果、RGBチャネルごとに独立してCRFをモデル化することで、実世界のシーンにおいて優れた性能が得られ、共有CRFモデルを上回った。
- 本手法で推定されたCRFは、実際のカメラ応答曲線とよく一致しており、物理的撮影プロセスをモデル化する微分可能トーンマッパーの有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。