Skip to main content
QUICK REVIEW

[論文レビュー] Dense Transformer Networks

Li Jun, Yongjun Chen|arXiv (Cornell University)|May 24, 2017
Advanced Neural Network Applications参考文献 27被引用数 15
ひとこと要約

本稿では、エンコーダーおよびデコーダー経路に非線形空間変換器を組み込んだ、データに依存するパッチ形状とサイズを学習するエンド・ツー・エンドでトレーニング可能な新規アーキテクチャ、Dense Transformer Networks (DTN) を提案する。非可微分性のないデコーダー層を用いて受容 field を適応的に学習し、空間的対応関係を回復させることで、推論時間のわずかな増加で、画像セグメンテーションベンチマークで最先端の性能を達成する。

ABSTRACT

The key idea of current deep learning methods for dense prediction is to apply a model on a regular patch centered on each pixel to make pixel-wise predictions. These methods are limited in the sense that the patches are determined by network architecture instead of learned from data. In this work, we propose the dense transformer networks, which can learn the shapes and sizes of patches from data. The dense transformer networks employ an encoder-decoder architecture, and a pair of dense transformer modules are inserted into each of the encoder and decoder paths. The novelty of this work is that we provide technical solutions for learning the shapes and sizes of patches from data and efficiently restoring the spatial correspondence required for dense prediction. The proposed dense transformer modules are differentiable, thus the entire network can be trained. We apply the proposed networks on natural and biological image segmentation tasks and show superior performance is achieved in comparison to baseline methods.

研究の動機と目的

  • 既存のディープラーニングモデルにおける固定で規則的な受容 field の制限を解消すること。
  • 推論時に各画素のコンテキストのパッチサイズおよび形状をデータ駆動で学習可能にする。
  • 非線形空間変換を用いても、入力画像と出力ラベルマップ間の空間的対応関係を保持すること。
  • 空間変換器をエンコーダ-デコーダー構造に統合した、微分可能でエンド・ツー・エンドでトレーニング可能なフレームワークを開発すること。
  • U-Net などのベースラインモデルと比較して、自然画像および生物学的画像セグメンテーションタスクで向上した性能を示すこと。

提案手法

  • エンコーダーおよびデコーダー経路に非線形空間変換(例:薄板スプライン)を備えた密度変換モジュールを導入し、不規則で適応的なパッチ形状を学習する。
  • エンコーダーに空間変換層を適用し、特徴マップを変換空間にマッピングし、元の空間における不規則なパッチ上で畳み込みおよびプーリングを実行する。
  • 入力と出力の特徴グリッド間の空間的対応関係を回復させるための、新規の微分可能なデコーダー層を開発する。
  • デコーダーで補間に基づくサンプリングを用い、変換された特徴位置を正規の出力グリッドにマッピングすることで、ピクセル単位の整合性を保証する。
  • エンコーダーおよびデコーダーの両方のコンponentを経由するバックプロパゲーションを用いたエンド・ツー・エンドのトレーニング戦略を採用し、共同最適化を可能にする。
  • U-Net に類似したエンコーダ-デコーダー・フレームワークに、密度変換モジュールを統合してセグメンテーションタスクに適用する。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングモデルは、固定で規則的な受容 field に依存せず、データに依存する最適なパッチ形状とサイズを学習できるか?
  • RQ2密度予測ネットワークで非線形空間変換を用いる場合、入力画像と出力ラベルマップ間の空間的対応関係をどのように保持できるか?
  • RQ3微分可能で学習可能な空間変換モジュールを、エンド・ツー・エンドのトレーニングのためにエンコーダーおよびデコーダー両方のパスに効果的に統合できるか?
  • RQ4適応的受容 field の使用により、自然画像および生物学的 EM 画像の困難なデータセットにおけるセグメンテーション精度が向上するか?
  • RQ5トレーニングおよび推論時間の観点から、学習可能な空間変換を導入する際の計算コストはどの程度か?

主な発見

  • 提案された Dense Transformer Network (DTN) は、SNEMI3D ブレイン EM 画像セグメンテーションタスクで 0.8953 AUC を達成し、ベースラインの U-Net モデル(0.8676 AUC)を上回った。
  • PASCAL VOC 2012 データセットでは、DTN は U-Net より優れたセグメンテーション性能を示し、定量的結果は境界予測の正確性の向上を示している。
  • DTN モジュールの追加により、PASCAL ではトレーニング時間が 6.1%、SNEMI3D では 10.7% 増加したが、推論時間はそれぞれ 13.2% および 9.1% 増加したにとどまった。
  • 新規の補間ベースのデコーダー層により、非線形変換の間でも空間的対応関係を効果的に保持でき、非線形変換があってもピクセル単位の正確な予測が可能になった。
  • モデルはドメインに跨る一般化性を示し、自然画像および複雑な生物学的 EM 画像の両方で、より良い結果を達成した。
  • アブレーションスタディにより、学習された受容 field が適応的かつデータ依存的であることが確認され、画像内の異なる領域でパッチ形状が変化していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。