Skip to main content
QUICK REVIEW

[論文レビュー] End to End Trainable Active Contours via Differentiable Rendering

Shir Gur, Tal Shaharabany|arXiv (Cornell University)|Dec 1, 2019
Advanced Vision and Imaging参考文献 41被引用数 7
ひとこと要約

本論文は、1つのエンコーダ・デコーダ推論から得られる学習済み2次元変位マップを用いて、微分可能レンダラーを介してポリゴンを変形させる、エンド・ツー・エンドで微分可能なアクティブな輪郭法を提案する。微分可能レンダリングによりバックプロパゲーションが可能となり、ポリゴン形状を正例マスクに対して直接最適化することで、医療、航空、都市系のベンチマークで最先端のセグメンテーション性能を達成した。

ABSTRACT

We present an image segmentation method that iteratively evolves a polygon. At each iteration, the vertices of the polygon are displaced based on the local value of a 2D shift map that is inferred from the input image via an encoder-decoder architecture. The main training loss that is used is the difference between the polygon shape and the ground truth segmentation mask. The network employs a neural renderer to create the polygon from its vertices, making the process fully differentiable. We demonstrate that our method outperforms the state of the art segmentation networks and deep active contour solutions in a variety of benchmarks, including medical imaging and aerial images. Our code is available at https://github.com/shirgur/ACDRNet.

研究の動機と目的

  • セマンティックセグメンテーションにおける境界精度を向上させる、シンプルでありながら強力なアクティブな輪郭法の開発。
  • セグメンテーション損失からポリゴン頂点にまで完全なバックプロパゲーションを可能にする、微分可能レンダリングを用いたアクティブな輪郭のエンド・ツー・エンド学習の実現。
  • 限られたデータを含む医療および航空画像を含む、多様なデータセットにおいて、既存のディープラーニングベースのアクティブな輪郭およびセマンティックセグメンテーションモデルを上回る性能の達成。
  • 最小限のアーキテクチャ(変位マップの単一推論、反復的監視なし)が優れた結果を達成できることの実証。
  • 従来の非微分可能な輪郭変形を置き換える学習可能で微分可能なポリゴン変形プロセスを用いることで、微分可能レンダリングの有効性をセグメンテーションタスクに裏付ける。

提案手法

  • 本手法は、入力画像に対して1回の順伝播で2次元変位マップを予測する、U-Netスタイルのエンコーダ・デコーダを用いる。
  • 変位マップはポリゴン頂点の移動を定義し、初期状態は正多角形(例:円)として設定され、反復的に変形される。
  • 微分可能メッシュレンダラー(Kato et al., 2018)により、変化するポリゴンがバイナリセグメンテーションマスクに変換され、頂点の変位に勾配が流れ込む。
  • 損失関数は、レンダリングされたポリゴンマスクと正例セグメンテーションマスクとの間の平均二乗誤差(MSE)として定義される。
  • 微分可能レンダラーを通じたバックプロパゲーションにより、勾配降下法を用いて頂点位置を最適化するエンド・ツー・エンドの学習が可能となる。
  • 本手法は反復的監視や補助損失を必要としないが、アブレーション実験では曲率損失およびバルーン損失の追加でわずかな性能向上が得られる。

実験結果

リサーチクエスチョン

  • RQ11つのエンド・ツー・エンドで微分可能なレンダリングパイプラインが、古典的な反復的アクティブな輪郭変形を、より優れた性能で置き換えることができるか?
  • RQ2直接的かつ単一推論による変位マップ予測が、段階的または力のバランスをとったアクティブな輪郭手法を上回るか?
  • RQ3セグメンテーション損失と微分可能レンダリングのみを用いた最小限のアーキテクチャが、多様なデータセットで最先端の結果を達成できるか?
  • RQ4ポリゴン頂点数や変形プロセスの反復回数が性能に与える感度はどの程度か?
  • RQ5従来の非微分可能な手法が失敗する状況でも、微分可能レンダリングがアクティブな輪郭の有効な学習を可能にするか?

主な発見

  • 本手法は、Cityscapesデータセットで75.09の平均IoUを達成し、PSP-DeepLab や Polygon-GCN といったすべてのベースラインを上回った。
  • Vaihingen航空画像データセットでは、64×64解像度で学習した場合、91.74%のmIoUと95.62%のF1スコアを達成したが、64ピクセル未満では性能が著しく低下した。
  • 約32頂点で性能が飽和し、低頂点数(例:4〜16頂点)ではDARNet(Cheng et al., 2019)と明確な性能差が生じた。
  • 1回の反復での学習でも優れた結果が得られたため、反復的精錬なしに変位マップが非常に有効であることが示された。
  • アブレーション実験では、複合損失(L_seg + L_K + L_B)が最良の性能(91.74% mIoU)を達成したが、MSEのみのベースライン損失でもSOTAを上回った。
  • 本手法はドメインに跨る一般化性能が高く、医療画像、航空画像、都市ストリートシーンのすべてでSOTAの結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。