[論文レビュー] Revisiting Implicit Neural Representations in Low-Level Vision
本稿では、汚損入力からのピクセル座標を用いてクリア画像を多層パーセプトロン(MLP)でパラメータライズする、Implicit Neural Representations(INR)を用いた低レベル画像修復のための新規手法LINRを提案する。LINRは、データが限られた状況下でも、ノイズ除去、超解像、穴埋め、ぼかし除去の各タスクで最先端の性能を達成し、限られたデータ設定下でPSNRが2 dB以上優れている。また、複数の汚損タイプを同時に学習させることで、驚くべき性能向上が得られる。
Implicit Neural Representation (INR) has been emerging in computer vision in recent years. It has been shown to be effective in parameterising continuous signals such as dense 3D models from discrete image data, e.g. the neural radius field (NeRF). However, INR is under-explored in 2D image processing tasks. Considering the basic definition and the structure of INR, we are interested in its effectiveness in low-level vision problems such as image restoration. In this work, we revisit INR and investigate its application in low-level image restoration tasks including image denoising, super-resolution, inpainting, and deblurring. Extensive experimental evaluations suggest the superior performance of INR in several low-level vision tasks with limited resources, outperforming its counterparts by over 2dB. Code and models are available at https://github.com/WenTXuL/LINR
研究の動機と目的
- 暗黙的ニューラル表現(INR)が、画像ノイズ除去、超解像、穴埋め、ぼかし除去などの低レベルビジョンタスクにおいて効果的であるかを調査すること。
- 特に、教師付きクリア画像が入手不可能な単一画像設定において、限られたもしくはペairedデータが存在しない状況での画像修復の課題に取り組むこと。
- INRベースのモデルが、タスク固有のアーキテクチャの再設計なしに、多様な低レベルビジョンタスクに一般化可能かどうかを検討すること。
- 複数の汚損タイプを同時に学習させることの影響を評価し、混合汚損が性能を低下させるという仮定に疑問を呈すること。
提案手法
- LINRは、ピクセル座標(x, y)を入力とし、RGB値を出力する多層パーセプトロン(MLP)を用いて、潜在的なクリア画像を連続関数として暗黙的に表現する。
- ネットワークは、サンプリングされたピクセル位置におけるMLP出力と観測された汚損画像との間の再構成誤差を最小化することで、エンドツーエンドに最適化される。
- 複雑な画像信号の効果的パラメータライズを可能にするために、SIREN活性化関数が採用され、標準的なReLUベースのMLPの制限を克服する。
- 学習は、1サンプルあたり1枚の汚損画像のみを用い、大規模なペアドデータセットを必要としない。これはDeep Image Prior(DIP)と同様のアプローチである。
- jointly training では、同じ元画像の複数の汚損バージョン(例:ノイズとぼかし)を用いてモデルを最適化する。
- 最適化プロセスは、汚損画像からクリア画像への直接的なマッピングを学習するのではなく、MLPのインダクティブバイアスを通じて高品質な画像表現を暗黙的に学習する。
実験結果
リサーチクエスチョン
- RQ11枚の汚損画像のみを用いて、ノイズ除去、超解像、穴埋め、ぼかし除去などのタスクで、暗黙的ニューラル表現(INR)が低レベルの画像ディテールを効果的に回復できるか?
- RQ2限られたデータとリソース制約下で、DIP や S2S などの既存の単一画像修復手法に比べ、INRベースのアプローチ(LINR)が優れた性能を発揮するか?
- RQ3複数の汚損タイプ(例:ノイズとぼかし)を同時に学習させることで、INRベースの画像修復の性能は、単一汚損学習と比べてどのように変化するか?
- RQ4アーキテクチャの変更なしに、LINRが4つの異なる低レベルビジョンタスクに効果的に一般化できるか。これは、INR表現の本質的な頑健性を示唆する。
主な発見
- 超解像(Set5, ×4)において、LINRはPSNR 31.20を達成し、DIP(26.40)に対して4.6 dBの向上を示し、すべてのベースラインを上回る。
- 10%のスパarsityを有する穴埋めでは、LINRはPSNR 26.85を達成し、DIP(24.57)とS2S(21.68)を大きく上回る。
- ガウスぼかし(σ=1.6)を伴うぼかし除去では、LINRの平均PSNRは31.20に達し、DIP(29.03)とDeepRED(30.35)を上回る。
- 複数の汚損タイプを同時に学習させた場合、PSNRは30.98に達し、単一汚損学習(ノイズ除去:27.63、超解像:28.60)を上回る。これは、相乗的な特徴学習が行われていることを示す。
- アーキテクチャの変更なしに、4つの異なる低レベルビジョンタスクに効果的に一般化でき、INRが画像修復に向けた汎用性を有していることを示している。
- 汚損タイプの多様性に対しても頑健であることが示され、対立する汚損タイプが存在するにもかかわらず、共同最適化が性能向上をもたらす。これは、汚損干渉の仮定に疑問を呈する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。