Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Convolutional Semantic Segmentation Learning

Mrinal Haloi|arXiv (Cornell University)|Oct 22, 2017
Retinal Imaging and Analysis参考文献 22被引用数 3
ひとこと要約

本論文は、畳み込みニューラルネットワークを用いたセマンティックセグメンテーションの共同エンドツーエンド学習フレームワークを提案する。このフレームワークは、事前学習モデルを必要とせず、分類とセグメンテーションの両ヘッドを同時に学習するが、協調学習の設定を採用し、新規に改良された残差インセプションブロックと部分的注意ゲーティング(PAG)を用いることで、収束を高速化し、精度を向上させる。本手法は、重みの初期化をランダムにした状態でも、EyePACSデータセットで66.1のmIOUを達成し、ImageNetでの事前学習を必要とするモデルを上回る性能を示した。

ABSTRACT

Deep convolutional semantic segmentation (DCSS) learning doesn't converge to an optimal local minimum with random parameters initializations; a pre-trained model on the same domain becomes necessary to achieve convergence.In this work, we propose a joint cooperative end-to-end learning method for DCSS. It addresses many drawbacks with existing deep semantic segmentation learning; the proposed approach simultaneously learn both segmentation and classification; taking away the essential need of the pre-trained model for learning convergence. We present an improved inception based architecture with partial attention gating (PAG) over encoder information. The PAG also adds to achieve faster convergence and better accuracy for segmentation task. We will show the effectiveness of this learning on a diabetic retinopathy classification and segmentation dataset.

研究の動機と目的

  • 深層畳み込みセマンティックセグメンテーションにおける収束のための事前学習モデルへの依存を排除すること。
  • 医療画像におけるラベル不足問題に対処し、分類のための部分的またはランダムラベルを用いた学習を可能にすること。
  • セグメンテーションと分類の学習プロセスを1つのエンドツーエンドフレームワークに統合すること。
  • 分類ヘッドとセグメンテーションヘッドの間で協調学習メカニズムを用いることで、収束速度とセグメンテーション精度を向上させること。
  • 本手法の有効性を、糖尿病網膜症検出および微小動脈瘤セグメンテーションのための実世界のバイオメディカルデータセット(EyePACS)において示すこと。

提案手法

  • セグメンテーションと分類のエージェントがパラメータを共有するが、別々の最適化手法を用い、同時に学習する協調学習フレームワークを導入する。
  • スキップ接続とバッチ正規化を備えた改良型の残差インセプションブロックを採用し、特徴量の学習を強化する。
  • 部分的注意ゲーティング(PAG)を適用し、エンコーダーのミドルレベル特徴量をデコーダーで選択的に使用することで、セグメンテーションの特徴表現を向上させる。
  • 分類エージェントに高いバッチサイズと学習率を設定し、情報の転送を加速させる。
  • Nesterovのモーメンタムを用い、多項式学習率スケジューリングとバッチ正規化を適用することで、共変量シフトを低減する。
  • TensorFlow上に構築されたカスタムフレームワーク(TEFLA)を用いて、学習と評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1事前学習モデルの初期化なしに、深層セマンティックセグメンテーションが最適な局所的最小値に収束可能か?
  • RQ2分類とセグメンテーションの共同学習が、セグメンテーション性能を向上させるとともに、ラベル付きセグメンテーションデータへの依存を低減できるか?
  • RQ3分類ヘッドを部分的またはランダムラベルで効果的に学習させても、セグメンテーション性能が劣化しないか?
  • RQ4部分的注意ゲーティングを用いた協調学習フレームワークが、標準的なエンコーダ-デコーダモデルと比較して、より高速な収束と高い精度を達成できるか?
  • RQ5共同モデルが、バイナリ分類における人間の眼科医の性能を上回ることができるか?

主な発見

  • 提案されたJointSegモデルは、EyePACSテストセットで66.1のmIOUを達成し、事前学習重みを用いたFCN-8s(55.3)とUNet(64.4)を顕著に上回った。
  • 重みをランダムに初期化した状態でも、FCN-8sとUNetはそれぞれ15.3と25.4のmIOUにとどまり、事前学習なしでは収束が著しく劣化することが示されたが、JointSegは66.1のmIOUを維持した。
  • 分類エージェントは、EyePACSテストセットでトップ1精度85.1%、トップ2精度88.1%を達成し、VGG-19(82.5%と85.3%)とInceptionV3(84.3%と87.2%)を上回った。
  • バイナリ分類における糖尿病網膜症分類では、共同モデルが95.5%の精度を達成し、人間の眼科医の性能(95.1%)をわずかに上回った。
  • 定性的な結果から、JointSegは特に小さな微小動脈瘤に対して、改善されたUNetベースラインと比較してより正確で繊細なセグメンテーションマスクを生成した。
  • 本手法により、分類のための部分的またはランダムラベルを用いた有効な学習が可能となり、医療画像におけるデータ不足問題に対処できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。