Skip to main content
QUICK REVIEW

[論文レビュー] Neural Stereoscopic Image Style Transfer

Xinyu Gong, Haozhi Huang|arXiv (Cornell University)|Feb 27, 2018
Advanced Image Processing Techniques参考文献 19被引用数 4
ひとこと要約

本論文では、視覚的一致性を保つステレオスコピック画像のための二重パス畳み込みニューラルネットワークを提案する。特徴量の可学習な集約ブロックとゲーティング機構、および複数層の視覚損失を用いて、左右の視覚間のスタイル転送を同期化する。本手法は、単一画像スタイル転送のベースラインと比較して、優れた視覚的一致性と知覚的品質を達成する。

ABSTRACT

Neural style transfer is an emerging technique which is able to endow daily-life images with attractive artistic styles. Previous work has succeeded in applying convolutional neural networks (CNNs) to style transfer for monocular images or videos. However, style transfer for stereoscopic images is still a missing piece. Different from processing a monocular image, the two views of a stylized stereoscopic pair are required to be consistent to provide observers a comfortable visual experience. In this paper, we propose a novel dual path network for view-consistent style transfer on stereoscopic images. While each view of the stereoscopic pair is processed in an individual path, a novel feature aggregation strategy is proposed to effectively share information between the two paths. Besides a traditional perceptual loss being used for controlling the style transfer quality in each view, a multi-layer view loss is leveraged to enforce the network to coordinate the learning of both the paths to generate view-consistent stylized results. Extensive experiments show that, compared against previous methods, our proposed model can produce stylized stereoscopic images which achieve decent view consistency.

研究の動機と目的

  • ステレオスコピック画像における視覚的一致性の欠如に起因する、左右の視覚間の不一致なスタイル転送が生じる問題に対処すること。
  • 深度認識と視覚的一致性を保ちながら、ステレオペアの両方の視覚を同時にスタイル転送するためのディープラーニングフレームワークを構築すること。
  • 特にオクルージョンや不一致領域においても、効果的にステレオ視覚間の特徴量を統合するメカニズムを設計すること。
  • 二重パスネットワークにおける両方のネットワークパス間のトレーニングを調整するための複数層の視覚損失を導入すること。

提案手法

  • モデルは、ステレオペアの左右の視覚を別々の同期されたストリームで処理する二重パスのエンコーダ・デコーダアーキテクチャを採用する。
  • 可学習な特徴量集約ブロックは、ワーピング、ゲーティング、および連結を用いて両方のパスからの特徴量を統合し、ゲートマップがオクルージョン領域からの信頼性の低い特徴量を抑制する学習を行う。
  • ゲーティング機構は、元の特徴量とワープされた特徴量の間で動的に選択を行い、不正確な視差推定によるアーチファクトを低減する。
  • 複数層の視覚損失は、複数の特徴量層にわたって適用され、両方の視覚間のスタイル化出力の一貫性を強制する。
  • 各個々の視覚におけるコンテンツの忠実性とスタイル転送の品質を維持するために、知覚的損失を視覚損失とともに使用する。
  • ネットワークは、知覚的損失、視覚損失、およびコンテンツ損失を組み合わせて、エンド・ツー・エンドにトレーニングされ、スタイル、コンテンツ、および視覚間の一貫性を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1視覚的一致性を保ちながらステレオスコピック画像に対してスタイル転送を実行できるディープニューラルネットワークを設計できるか?
  • RQ2オクルージョンや視差誤差によって生じる不一致を低減するために、ステレオ視覚間の特徴量統合を効果的に学習する方法は何か?
  • RQ3二重パスネットワークにおける左右の視覚のスタイル転送を調整するために、最も効果的な損失関数は何か?
  • RQ4複数層の視覚損失は、単一層または損失なしのケースと比較して、一貫性を向上させるか?

主な発見

  • 主観的評価において、本手法は73%の票を獲得し、ジョンソンらの単一画像スタイル転送手法の結果よりもユーザーの好みが高かった。
  • 提案された特徴量集約ブロックを備えたW-G-CON-IVバージョンは、最小の複数層視覚損失(1028)と複数コンテンツ損失(481,056)を達成し、優れた視覚的一致性とコンテンツ保持性を示した。
  • ゲートマップの可視化により、ネットワークが右視覚のオクルージョン領域からの特徴量を学習的に抑制していることが確認された。
  • アブレーションスタディの結果、特徴量の連結(CON-IV)は単一画像ベースライン(SingleImage-IV)と比較して視覚損失を低減した。さらに、W-G-CON-IVの完全なモデルは性能をさらに向上させた。
  • 複数層の視覚損失は、MVLが低く、ステレオペア全体にわたって一貫性のあるスタイル化出力が得られることから、視覚的一致性を顕著に低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。