Skip to main content
QUICK REVIEW

[論文レビュー] S3Net: A Single Stream Structure for Depth Guided Image Relighting

Hao-Hsiang Yang, Wei‐Ting Chen|arXiv (Cornell University)|May 3, 2021
Advanced Vision and Imaging参考文献 36被引用数 4
ひとこと要約

S3Net は、ソース画像とガイド画像とその深度マップを入力として、アテンションとリーマンモジュールを強化したエンコーダデコーダアーキテクチャを用いてリライト画像を生成する単一ストリームの深層学習フレームワークであり、深度ガイド付きの任意対任意画像リライトを実現する。Waveletベースの SSIM 損失を用いることで視認品質を向上させ、NTIRE 2021 チャレンジで 3 位を達成し、VIDIT データセットで 0.6969 の SSIM を達成した。

ABSTRACT

Depth guided any-to-any image relighting aims to generate a relit image from the original image and corresponding depth maps to match the illumination setting of the given guided image and its depth map. To the best of our knowledge, this task is a new challenge that has not been addressed in the previous literature. To address this issue, we propose a deep learning-based neural Single Stream Structure network called S3Net for depth guided image relighting. This network is an encoder-decoder model. We concatenate all images and corresponding depth maps as the input and feed them into the model. The decoder part contains the attention module and the enhanced module to focus on the relighting-related regions in the guided images. Experiments performed on challenging benchmark show that the proposed model achieves the 3 rd highest SSIM in the NTIRE 2021 Depth Guided Any-to-any Relighting Challenge.

研究の動機と目的

  • ソース画像をガイド画像の照明に一致させる深度マップを用いた、深度ガイド付きの任意対任意画像リライトという新規チャレンジに取り組むこと。
  • 二重ストリームネットワークの計算負荷を回避しつつ、RGB と深度特徴を効果的に統合できる効率的な単一ストリームアーキテクチャを設計すること。
  • 方向性の照明と影の転送を改善するために、アテンション機構と強化された特徴精錬モジュールをデコーダーに統合し、リライト品質を向上させること。
  • 離散ウェーブレット変換に基づくマルチスケール損失関数を最適化に用いて、グローバルおよびローカルの画像忠実度を向上させること。
  • NTIRE 2021 深度ガイド付き任意対任意リライトチャレンジで最先端のパフォーマンスを達成すること。

提案手法

  • モデルは、ソース画像とガイド画像とその対応する深度マップを連結して 6 チャネルの入力テンソルとする単一ストリームのエンコーダデコーダアーキテクチャを採用する。
  • エンコーダーは、マルチスケールの感受野拡張を実現する Res2Net ブロックを用いて階層的特徴を抽出する。
  • デコーダーは、リライト関連領域に注目を向けるアテンションモジュールと、影と照明の一貫性を向上させるために特徴マップを精錬する強化モジュールを統合する。
  • トレーニング段階で、マルチスケールの構造的詳細を捉えることで視認品質を向上させるために、ウェーブレットベースの SSIM 損失(L_{W-SSIM})が使用される。
  • 色、構造、視認の忠実度を確保するため、L_{Cha}、L_{SSIM}、L_{Per} の損失関数を組み合わせるが、最良のパフォーマンスを得た設定では L_{SSIM} の代わりに L_{W-SSIM} を使用する。
  • ネットワークは VIDIT データセット上でエンドツーエンドにトレーニングされ、1024×1024 画像あたりの推論時間は 2.042 秒である。

実験結果

リサーチクエスチョン

  • RQ1二重ストリームの複雑さを回避しつつ、単一ストリームネットワークが RGB と深度特徴を効果的に統合できるか?
  • RQ2アテンションモジュールと強化モジュールの統合が、影と照明の転送においてリライト品質をどのように向上させるか?
  • RQ3標準の SSIM と比較して、ウェーブレット SSIM 損失がリライトタスクにおける視認品質をどの程度向上させるか?
  • RQ4深度マップを空間的ガイドとして用いることで、色温度や方向照明を含む多様な照明条件下でもモデルが一般化できるか?
  • RQ5提案手法は、NTIRE 2021 ベンチマークにおいて、既存の手法と比較してどの程度のパフォーマンスを示すか?

主な発見

  • 提案された S3Net は、NTIRE 2021 深度ガイド付き任意対任意リライトチャレンジで SSIM と MPS の両面で 3 位を達成し、検証用 SSIM は 0.7022、テスト用 SSIM は 0.6784 を記録した。
  • テストセットでは PSNR が 19.2212、LPIPS が 0.1566 であり、優れた視認的および構造的忠実度を示した。
  • アブレーションスタディの結果、画像のみを使用する設定(設定1)から深度マップを追加した設定(設定2)に変更することで、SSIM が 0.6821 から 0.6913 に向上した。
  • 標準の SSIM をウェーブレット SSIM に置き換えた(設定3)ことで、さらに SSIM が 0.6969 に向上し、PSNR も 19.1281 に向上した。これによりマルチスケール損失の有効性が確認された。
  • 視覚的比較により、ウェーブレット SSIM 損失が、真値に近いリライト画像を生成し、影の除去と照明転送の両面で優れた性能を示していることが確認された。
  • 深度マップの情報が限られているため、大きな曇りや曇った影を有する画像では失敗した。今後の研究では、3D 理解の向上が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。