Skip to main content
QUICK REVIEW

[論文レビュー] Shadow Transfer: Single Image Relighting For Urban Road Scenes

Alexandra Carlson, Ram Vasudevan|arXiv (Cornell University)|Sep 23, 2019
Image Enhancement Techniques参考文献 38被引用数 6
ひとこと要約

本稿では、RGB画像、深度マップ、セマンティックセグメンテーションマスクのみを用いて、現実的な影、陰影、色温度を転送することで、1枚の屋外都市風景を再照明化する自己教師付きディープラーニングフレームワーク「Shadow Transfer」を提案する。この手法は、合成データ(CARLA-sun)および実データ(KITTI-sun)の両方において、最先端の画像対画像変換手法を上回る視覚的品質と写実的美しさを達成し、照明アノテーションのラベルが不要であるにもかかわらず、より高い知覚的忠実度を実現した。

ABSTRACT

Illumination effects in images, specifically cast shadows and shading, have been shown to decrease the performance of deep neural networks on a large number of vision-based detection, recognition and segmentation tasks in urban driving scenes. A key factor that contributes to this performance gap is the lack of `time-of-day' diversity within real, labeled datasets. There have been impressive advances in the realm of image to image translation in transferring previously unseen visual effects into a dataset, specifically in day to night translation. However, it is not easy to constrain what visual effects, let alone illumination effects, are transferred from one dataset to another during the training process. To address this problem, we propose deep learning framework, called Shadow Transfer, that can relight complex outdoor scenes by transferring realistic shadow, shading, and other lighting effects onto a single image. The novelty of the proposed framework is that it is both self-supervised, and is designed to operate on sensor and label information that is easily available in autonomous vehicle datasets. We show the effectiveness of this method on both synthetic and real datasets, and we provide experiments that demonstrate that the proposed method produces images of higher visual quality than state of the art image to image translation methods.

研究の動機と目的

  • 影や色温度の変化といった変動する照明条件が自動運転タスクにおけるディープニューラルネットワークの性能を低下させることを是正すること。
  • ラベル付き照明データを必要とせずに、現実の都市風景に現実的な照明効果を再照明化する手法を開発すること。
  • 自動運転車両のデータセットに一般的に存在する、RGB画像、深度マップ、セマンティックセグメンテーションマスクといった容易に入手可能なセンサデータを活用する自己教師付きフレームワークを構築すること。
  • 訓練データに現実的な照明転送を組み込むことで、視覚ベースのモデル(例:検出、セグメンテーション)の時間帯の変化へのロバスト性を向上させること。
  • 合成データと現実世界データの間のドメインギャップを埋めるために、幾何学的・素材的整合性を保持する写実的な再照明画像を生成すること。

提案手法

  • フレームワークは、事前学習済みのSunEst-CNNモデルからの特徴に基づく知覚的損失を含むマルチタスク損失を用いて自己教師付きで訓練される深層エンコーダデコーダアーキテクチャを採用する。
  • 入力は、1台のカメラビューから得られる1枚のRGB画像、推定された深度マップ、およびセマンティックセグメンテーションマップから構成される。
  • モデルは、入力の幾何学的形状と外観を条件として、影、陰影、グローバルな色温度といった照明効果を転送することで、再照明化されたRGB画像を予測する。
  • 主なイノベーションは、照明に特化した特徴を保持するよう促すSunEst-CNN特徴損失の使用であり、これは真の照明ラベルが不要であるにもかかわらず、リアリズムを向上させる。
  • エンドツーエンドのアプローチにより、複数の視点や素材特性の事前知識を必要とせず、任意の時間帯の条件での再照明が可能である。
  • フレームワークは合成データ(CARLA-sun)で訓練され、実データ(KITTI-sun)でファインチューニングされることで、現実世界のシーンへの一般化が可能になった。

実験結果

リサーチクエスチョン

  • RQ1標準的な自動運転車両センサデータのみを用いて、自己教師付きディープラーニングモデルが、1枚の屋外シーン画像に現実的な影と陰影を効果的に転送できるか。
  • RQ2提案されたShadow Transferフレームワークは、視覚的品質およびアーティファクト生成の観点から、最先端のマルチドメイン画像対画像変換モデルと比較してどのように差をつけるか。
  • RQ3深度マップとセマンティックセグメンテーションマップの入力が、再照明出力画像のリアリズムと正確性にどの程度寄与しているか。
  • RQ4ドメイン特化の特徴損失(SunEst-CNN)を組み込むことで、現実世界のシーンにおける時間帯に応じた照明変化をモデルがより正確に捉える能力が向上するか。
  • RQ5合成データから現実世界の都市部の道路シーンに一般化できるか。この際、写実的美しさを保持し、アーティファクトを最小限に抑えることができるか。

主な発見

  • CARLA-sunの合成データセットにおいて、Shadow Transferは、すべての光源位置でComboGANおよびStarGANを上回る平均構造的類似度(MSSIM)を達成し、優れた知覚的品質を示した。
  • 提案手法は、色温度と影を捉えることができたにもかかわらず、顕著な変換アーティファクトを引き起こしたComboGANと比較して、ぼやけや歪みなどの視覚的アーティファクトが少なかった。
  • アブレーションスタディの結果、深度マップとセグメンテーションマップを併用することで、単独で使用する場合よりも画像品質が著しく向上した。SunEst-CNN損失は二次的ではあるが、有意義な改善をもたらした。
  • 実データのKITTI-sunデータセットにおいて、SunEst-CNN損失を含む完全なモデルは、照明特徴を効果的に転送できたが、この損失を含まないモデルは、意味のある照明効果の転送に失敗した。
  • 深度マップのみのモデルはより現実的なピクセル統計を保持したが、セグメンテーションマップのみのモデルは動的影の分布をよりよく捉えており、両者の入力が相補的な強みを示した。
  • 強力な性能を発揮したにもかかわらず、モデルは高周波数ノイズや局所的なテクスチャディテールの処理に苦労しており、これは入力の深度マップおよびセグメンテーションマップの解像度が粗いことが主な要因とみられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。