[論文レビュー] GANs-NQM: A Generative Adversarial Networks based No Reference Quality Assessment Metric for RGB-D Synthesized Views
本稿では、RGB-D合成画像のための非参照品質指標である GANs-NQM を提案する。この手法は、RGB-Dデータではなく大規模2Dデータセットで訓練された生成対抗ネットワーク(GAN)を用いる。訓練済みの識別器を活用して「歪み語のBag(BDW)」コードブックを学習し、局所的な歪みを特定することで、最先端の指標を上回る正確な知覚的品質予測が可能になる。また、副次的効果として高品質なコンテキスト補填器(inpainter)も得られる。
In this paper, we proposed a no-reference (NR) quality metric for RGB plus image-depth (RGB-D) synthesis images based on Generative Adversarial Networks (GANs), namely GANs-NQM. Due to the failure of the inpainting on dis-occluded regions in RGB-D synthesis process, to capture the non-uniformly distributed local distortions and to learn their impact on perceptual quality are challenging tasks for objective quality metrics. In our study, based on the characteristics of GANs, we proposed i) a novel training strategy of GANs for RGB-D synthesis images using existing large-scale computer vision datasets rather than RGB-D dataset; ii) a referenceless quality metric based on the trained discriminator by learning a `Bag of Distortion Word' (BDW) codebook and a local distortion regions selector; iii) a hole filling inpainter, i.e., the generator of the trained GANs, for RGB-D dis-occluded regions as a side outcome. According to the experimental results on IRCCyN/IVC DIBR database, the proposed model outperforms the state-of-the-art quality metrics, in addition, is more applicable in real scenarios. The corresponding context inpainter also shows appealing results over other inpainting algorithms.
研究の動機と目的
- 非均一な補填歪みが生じる欠損領域におけるRGB-D合成画像の知覚的品質評価の課題に対処すること。
- 参照画像を必要としない非参照品質指標の開発により、リアルタイムかつ実用的な展開を可能にすること。
- 小規模でノイズの多いRGB-Dデータセットの制限を克服し、大規模2Dコンピュータビジョンデータセットで学習すること。
- GAN学習プロセスの副産物として、高精度なコンテキスト補填器を同時に生成すること。
- 複雑なテクスチャ領域や物体境界におけるぼやけやゴースト化などの知覚的に重要な歪みをモデル化すること。
提案手法
- RGB-Dデータセットではなく2D画像データセット(例:ImageNet)のみを用いる、新しいGAN学習戦略を提案。合成深度マップとマスキングを用いて欠損領域のアーティファクトを模擬する。
- 識別器を微調整し、「歪み語のBag(BDW)」コードブックを学習させ、合成画像からの局所的歪みパターンを符号化する。
- 識別器の特徴マップから導出される局所的歪み領域セレクタを用いて、非均一な補填アーティファクトを特定・局所化する。
- BDWコードブックと歪み領域特徴をサポートベクターレグレッサー(SVR)の入力として用い、知覚的品質スコアを予測する。
- 訓練済みGANの生成器を、RGB-D合成における欠損領域のコンテキスト補填器として再利用。同じ学習データとアーキテクチャを活用する。
- 穴埋めにおける構造的・テクスチャ的忠実度を保持するため、知覚的損失と敵対的損失の組み合わせを用いてモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1大規模2D画像データセットで訓練されたGANが、参照画像やRGB-Dデータセットを一切必要とせずに、RGB-D合成画像の知覚的品質を効果的に評価できるか。
- RQ2GANの識別器をどのように活用すれば、合成画像の欠損領域における非均一な補填歪みを検出し、定量的に評価できるか。
- RQ3このようなGANの生成器を効果的に再利用し、RGB-D合成のための高性能なコンテキスト補填器として機能させられるか。
- RQ4提案手法である GANs-NQM は、実世界のRGB-D合成データに対して、既存の最先端のフルレファレンスおよび非参照品質指標と比較してどの程度の性能を示すか。
- RQ5ノイズの多い深度データを避ける本手法の訓練戦略は、実世界の欠損アーティファクトにどの程度一般化可能か。
主な発見
- IRCCyN/IVC DIBRデータベースにおいて、GANs-NQMは全評価指標の中で最高の性能を示し、フルレファレンスおよび非参照の最先端手法を上回った。
- モデルの正規化実行時間は1.25であり、2番目に速いNR指標APTおよび最良のFR指標ST-IQMよりも顕著に高速で、リアルタイム適用性が顕著に優れている。
- 事前学習済みの生成器(補填器)は、特に物体境界や均一なテクスチャ領域で、他の補填アルゴリズムと比較して優れた結果を達成した。
- 髪の毛の一本一本やポスターの角といった微細構造をより正確に保持し、ゴースト化や二重エッジアーティファクトを低減した。
- RGB-Dデータセットではなく2Dデータセットを用いることで、わずか1万枚の画像での学習でも効果的な性能が得られ、限られたデータでもスケーラビリティとロバストネスを示した。
- BDWコードブックと局所的歪みセレクタは、知覚的に顕著なアーティファクトを効果的に捉えており、複雑で非均一な歪みパターンに対しても正確な品質予測が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。