[論文レビュー] Aleth-NeRF: Low-light Condition View Synthesis with Concealing Fields
Aleth-NeRFは、シーンと観測者間の光の減衰を表す代替モデルである'Concealing Fields'を導入することで、低照度条件下における視覚合成のための教師なしNeRFベース手法を提案する。本手法は、暗いマルチビューsRGB画像のみを用いて学習し、推論時にConcealing Fieldsを除去することで、2D増幅手法に比べて優れた3次元マルチビュー一貫性と画像品質を達成する。新しく収集したLOMデータセットにおいて、SSIM、PSNR、LPIPSの各指標でベースラインを上回っている。
Common capture low-light scenes are challenging for most computer vision techniques, including Neural Radiance Fields (NeRF). Vanilla NeRF is viewer-centred simplifies the rendering process only as light emission from 3D locations in the viewing direction, thus failing to model the low-illumination induced darkness. Inspired by the emission theory of ancient Greeks that visual perception is accomplished by rays casting from eyes, we make slight modifications on vanilla NeRF to train on multiple views of low-light scenes, we can thus render out the well-lit scene in an unsupervised manner. We introduce a surrogate concept, Concealing Fields, that reduces the transport of light during the volume rendering stage. Specifically, our proposed method, Aleth-NeRF, directly learns from the dark image to understand volumetric object representation and concealing field under priors. By simply eliminating Concealing Fields, we can render a single or multi-view well-lit image(s) and gain superior performance over other 2D low-light enhancement methods. Additionally, we collect the first paired LOw-light and normal-light Multi-view (LOM) datasets for future research. This version is invalid, please refer to our new AAAI version: arXiv:2312.09093
研究の動機と目的
- 通常のNeRFが照明不足とマルチビュー一貫性の欠如により低照度シーンで失敗する問題に対処すること。
- NeRF学習の前段階で適用される2D低照度増幅手法が3次元幾何的一貫性を損なうという制限を克服すること。
- 教師なしで、暗い画像から体積的シーン表現と隠蔽効果を同時に学習するNeRFの変種を提案すること。
- 将来の低照度3次元シーン理解研究のため、低照度と通常照度のペアで構成される最初のマルチビューデータセット(LOM)を収集・公開すること。
提案手法
- 視認方向における光の減衰を表すために'Concealing Fields'を導入し、NeRFの透過関数を拡張して低照度状態をモデル化する。
- 学習中に低照度マルチビューsRGB画像のみを用いて、放射場とConcealing Fieldsを同時に最適化するように通常のNeRFを変更する。
- 推論時にConcealing Fieldsを単に除去することで、教師なし増幅を達成する、明るいシーンのレンダリングを可能にする。
- レイトレーシングの積分ステップにおいてConcealing Fieldsを乗算型減衰要因として組み込む微分可能ボリュームレンダリングプロセスを採用する。
- 古代ギリシャの発光理論(視覚は目から発する光線によって生じる)を比喩的に用い、隠れた構造を「解き放つ」問題として定式化する。
- 通常のNeRF損失を暗い画像に適用して、正常照度の教師データを一切必要としないエンドツーエンドの学習を実施する。

実験結果
リサーチクエスチョン
- RQ1通常照度の教師データなしで、低照度画像のみを用いてNeRFを効果的に学習し、明るい新規ビューを合成できるか?
- RQ2Concealing Fieldsを用いて光の減衰をモデル化することで、2D増幅手法によるNeRF出力の事後処理に比べ、マルチビュー一貫性がどのように向上するか?
- RQ3NeRFベースの視覚合成に統合された場合、提案手法は最先端の2D低照度増幅技術をどの程度上回るか?
- RQ4物理的直感に基づくConcealing Fieldの概念を用いることで、低照度下でもより頑健かつ汎用性の高い3次元シーン再構築が可能になるか?
- RQ51つのシーン固有のNeRFモデルを暗い画像から学習することで、2D増幅とNeRFの微調整を含むマルチステージパイプラインに比べ、より優れた性能が得られるか?
主な発見
- Aleth-NeRFは、LOMデータセットにおいてSSIM、PSNR、LPIPSの全指標で最高の平均性能を達成し、'NeRF + 2D増幅'および'2D増幅 + NeRF'のベースラインを上回っている。
- 'NeRF + 2D増幅'パイプラインは、'2D増幅 + NeRF'よりも劣っていることが判明し、低品質なNeRF出力が2D増幅の結果を悪化させていることが示された。
- '2D増幅 + NeRF'パイプラインは、各ビュー間での2D増幅の不一致により、新規ビュー生成にアーティファクトと不一致が生じている。
- Aleth-NeRFは、'ソファ'、'自転車'、'低木'のシーンにおける可視化と定量的指標によって、高いマルチビュー一貫性と画像品質を維持している。
- 本手法は、LOMデータセットで最先端の性能を達成し、暗い画像からのエンドツーエンド教師なし学習が3次元ビュー合成に有効であることを示している。
- 5つの実世界のシーンを含み、1シーンあたり25〜65枚のペアな低照度・通常照度ビューを持つLOMデータセットは、マルチビュー低照度増幅の信頼性ある評価を可能にする。
![Figure 2: (a). NeRF rendering results in normal-light scene and low-light scene. (b). NeRF rendering on enhanced scene by 2D image enhancement methods LIME [ 12 ] and IAT [ 5 ] . (c) Aleth-NeRF rendering results in low-light scene.](https://ar5iv.labs.arxiv.org/html/2303.05807/assets/pics/demo.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。