Skip to main content
QUICK REVIEW

[論文レビュー] TOM-Net: Learning Transparent Object Matting from a Single Image

Guanying Chen, Kai Han|arXiv (Cornell University)|Mar 13, 2018
Image Enhancement Techniques参考文献 19被引用数 8
ひとこと要約

TOM-Net は、マルチスケールエンコーダーデコーダーネットワークに続く残差リファインメントネットワークを用いて、1枚の入力画像から物体マスク、減衰マスク、屈折フローフィールドを同時に予測することで、透過的物体のマットングを推定するディーブラーニングフレームワークである。合成データセットと実世界のベンチマークの両方で最先端の性能を達成し、1回のフォワードパスで堅牢な一般化性能と現実的な合成結果を実現している。

ABSTRACT

This paper addresses the problem of transparent object matting. Existing image matting approaches for transparent objects often require tedious capturing procedures and long processing time, which limit their practical use. In this paper, we first formulate transparent object matting as a refractive flow estimation problem. We then propose a deep learning framework, called TOM-Net, for learning the refractive flow. Our framework comprises two parts, namely a multi-scale encoder-decoder network for producing a coarse prediction, and a residual network for refinement. At test time, TOM-Net takes a single image as input, and outputs a matte (consisting of an object mask, an attenuation mask and a refractive flow field) in a fast feed-forward pass. As no off-the-shelf dataset is available for transparent object matting, we create a large-scale synthetic dataset consisting of 158K images of transparent objects rendered in front of images sampled from the Microsoft COCO dataset. We also collect a real dataset consisting of 876 samples using 14 transparent objects and 60 background images. Promising experimental results have been achieved on both synthetic and real data, which clearly demonstrate the effectiveness of our approach.

研究の動機と目的

  • 透過的物体の1枚画像からのマットングの課題に取り組む。これは、複雑な光の屈折効果のため、極めて不適切な問題である。
  • 複数枚の画像や専用ハードウェアを必要とせずに、環境マットング(物体マスク、減衰マスク、屈折フローフィールド)を推定できるディーブラーニングフレームワークの開発。
  • 透過的物体マットングのためのベンチマークとして使用できる、大規模な合成データセットと実世界のデータセットの作成。
  • 画像編集や映画制作における実用的導入を想定し、高速でフォワードパスによる推論を可能にする。

提案手法

  • 1枚の入力画像から得られる屈折フロー推定として、透過的物体マットングを定式化し、光の屈折効果をモデル化する。
  • 粗い予測を実行するマルチスケールエンコーダーデコーダーと、リファインメントを実行する残差ネットワークからなる2段階アーキテクチャであるTOM-Netを設計する。
  • COCOの背景に透過的物体をレンダリングした17万8千枚の合成画像を用いて、ネットワークをエンドツーエンドで学習する。
  • 一般化性能の評価に、14種類の透過的物体と60枚の背景画像から構成される876サンプルの実データセットを用いる。
  • 構造的および視覚的リアリズムを保つために、L1損失と知覚的損失の組み合わせでモデルを最適化する。
  • 1回のフォワードパスで、新しい背景に合成可能な完全なマットを出力する推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ディープニューラルネットワークは、透過的物体の1枚画像から環境マットングを正確に推定できるか?
  • RQ2複数枚の画像や特別なパターンを必要とせず、屈折フロー推定として透過的物体マットングをモデル化することは可能か?
  • RQ3合成データで学習したモデルは、実世界の透過的物体にどれほど一般化できるか?
  • RQ4予測されたマットを用いて、新しい背景に再合成した場合、視覚的に現実的でない合成結果が得られるか?

主な発見

  • 合成データセットでは、ガラスカテゴリにおいてPSNRが27.6、SSIMが0.95を達成し、マット予測の高精度を示している。
  • 実データでは、平均PSNRが21.84、SSIMが0.890であり、単純な形状では高い性能を示したが、不透明なベースや鋭いエッジがある複雑な形状では性能が低かった。
  • ユーザースタディの結果、1380個の合成画像のうち827個が本物の写真と区別がつかないと判断され、優れた視覚的リアリズムを示している。
  • 単一の物体で学習したにもかかわらず、複数の透過的物体を含む画像に対してもTOM-Netは良好に一般化し、堅牢性と転移性を示している。
  • 正確な屈折フロー推定により、現実的な屈折効果を再現し、新しい背景への高品質な合成を可能にした。
  • 提案された合成データセットと実データセットは、今後の透過的物体マットング分野の研究における有効なベンチマークである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。