Skip to main content
QUICK REVIEW

[論文レビュー] Joint Image Filtering with Deep Convolutional Networks

Yijun Li, Jia‐Bin Huang|arXiv (Cornell University)|Oct 11, 2017
Advanced Vision and Imaging参考文献 46被引用数 7
ひとこと要約

本論文では、ターゲット画像とガイド画像を共同で処理する3つの畳み込みサブネットワークを用いた、深層学習に基づく共同画像フィルタリングフレームワークを提案する。このフレームワークは、ノイズや一貫性のないテクスチャを抑制しながら、一貫した構造的詳細を効果的に転送する。RGB/深度データで学習されたモデルは、フラッシュ/非フラッシュやRGB/NIRなどの多様なモダリティに効果的に一般化でき、深度アップサンプリングおよびクロスモダリティノイズ除去において最先端の性能を達成し、効率的な推論が可能である。

ABSTRACT

Joint image filters leverage the guidance image as a prior and transfer the structural details from the guidance image to the target image for suppressing noise or enhancing spatial resolution. Existing methods either rely on various explicit filter constructions or hand-designed objective functions, thereby making it difficult to understand, improve, and accelerate these filters in a coherent framework. In this paper, we propose a learning-based approach for constructing joint filters based on Convolutional Neural Networks. In contrast to existing methods that consider only the guidance image, the proposed algorithm can selectively transfer salient structures that are consistent with both guidance and target images. We show that the model trained on a certain type of data, e.g., RGB and depth images, generalizes well to other modalities, e.g., flash/non-Flash and RGB/NIR images. We validate the effectiveness of the proposed joint filter through extensive experimental evaluations with state-of-the-art methods.

研究の動機と目的

  • 従来の共同フィルタがガイド画像に依存するのみで、一貫性のないまたは余分な構造を転送する可能性があるという限界を解消すること。
  • データ駆動型でエンド・ツー・エンドで学習可能なフレームワークを構築し、ターゲット画像とガイド画像を共同でモデル化することで、構造の一貫性を向上させること。
  • 再トレーニングなしで、RGB/深度、フラッシュ/非フラッシュ、RGB/NIRなどの異なる画像モダリティ間で一般化できること。
  • 手作業で設計された目的関数や反復的最適化に依存することを減らし、より高速で一貫性のあるフィルタリングを実現すること。

提案手法

  • 本手法は3つのサブネットワークを採用する:CNN_Tはターゲット画像から特徴を抽出し、CNN_Gはガイド画像から特徴を抽出する。
  • 両画像の特徴を連結し、第3のネットワークであるCNN_Fに供給する。CNN_Fは顕著で一貫性のある構造の選択的転送を学習する。
  • 劣化したターゲット画像と正解との間の残差を学習させるためにスキップ接続を採用し、学習の安定性と性能を向上させる。
  • 段階的トレーニングを一切行わず、大規模なRGB/深度データセットを用いて、ネットワーク全体をエンド・ツー・エンドで学習する。
  • モダリティのシフトに強く、フラッシュ/非フラッシュやRGB/NIRなどの未学習のデータタイプへの転送が可能であるようにアーキテクチャを設計する。
  • ネットワークの深さやマージレイヤーの位置といったハイパーパrameterは、モデルサイズと性能のバランスを取るためにアブレーションされ、最適な深さは d=3 に設定された。

実験結果

リサーチクエスチョン

  • RQ1手作業で設計された固定フィルタに依存する従来の手法よりも、深層学習ベースの共同フィルタが構造転送において優れた性能を発揮できるか?
  • RQ2RGB/深度データで学習したモデルが、フラッシュ/非フラッシュやRGB/NIRなどの他のモダリティにどの程度一般化できるか?
  • RQ3ガイド画像のみを用いるアプローチと比較して、ターゲット画像とガイド画像を同時にモデル化することで、フィルタリング性能がどの程度向上するか?
  • RQ4スキップ接続や特徴統合を含むネットワークアーキテクチャが、一貫性のないテクスチャの抑制能力にどのように影響するか?
  • RQ5精度と計算コストの観点から、ネットワークの深さと性能のトレードオフはどのようなものか?

主な発見

  • 提案手法は、NYUv2データセットにおいて深度アップサンプリングで5.86 cmという最先端のRMSEを達成し、先行手法を上回った。
  • SUN RGB-Dデータセットでも、5.86 cmという競争力のあるRMSEを達成し、優れた一般化性能を示した。
  • 訓練データがRGB/深度データのみであったにもかかわらず、フラッシュ/非フラッシュやRGB/NIRの画像ペアといった未学習のモダリティに対しても、良好な一般化性能を示した。
  • ガイド画像に小規模なテクスチャ(たとえば、磁器やカーペットの模様)が存在する場合、細かいディテールが過剰に平滑化される傾向があり、性能が低下した。
  • 最適なアーキテクチャでは、各サブネットワークの深さを d=3 に設定し、モデルサイズと性能のバランスを最適化した。d=5 の場合、モデルサイズは11.4 MB であった。
  • アブレーションスタディの結果、特徴を第3層でマージする(3/3–3)設定が最良の性能を示し、RMSE 5.86 cm を達成した。浅いまたは深い構成よりも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。