Skip to main content
QUICK REVIEW

[論文レビュー] Normalization in Training U-Net for 2D Biomedical Semantic Segmentation

Xiao-Yun Zhou, Guang‐Zhong Yang|arXiv (Cornell University)|Sep 11, 2018
Advanced Neural Network Applications参考文献 22被引用数 4
ひとこと要約

本稿では、2次元医療画像セマンティックセグメンテーションのU-Net訓練において、バッチ正規化(BN)、インスタンス正規化(IN)、レイヤー正規化(LN)、グループ正規化(GN)の4つの正規化手法を評価している。内部コホービエートシフトの処理が優れているため、特に小バッチまたは患者特有のデータにおいて、BN よりも GN で大きなグループ数を使用するか、IN を用いることで、モデルの汎化性能とセグメンテーション精度がより顕著に向上することが判明した。

ABSTRACT

2D biomedical semantic segmentation is important for robotic vision in surgery. Segmentation methods based on Deep Convolutional Neural Network (DCNN) can out-perform conventional methods in terms of both accuracy and levels of automation. One common issue in training a DCNN for biomedical semantic segmentation is the internal covariate shift where the training of convolutional kernels is encumbered by the distribution change of input features, hence both the training speed and performance are decreased. Batch Normalization (BN) is the first proposed method for addressing internal covariate shift and is widely used. Instance Normalization (IN) and Layer Normalization (LN) have also been proposed. Group Normalization (GN) is proposed more recently and has not yet been applied to 2D biomedical semantic segmentation, however, no specific validations on GN were given. Most DCNNs for biomedical semantic segmentation adopt BN as the normalization method by default, without reviewing its performance. In this paper, four normalization methods - BN, IN, LN and GN are compared in details, specifically for 2D biomedical semantic segmentation. U-Net is adopted as the basic DCNN structure. Three datasets regarding the Right Ventricle (RV), aorta, and Left Ventricle (LV) are used for the validation. The results show that detailed subdivision of the feature map, i.e. GN with a large group number or IN, achieves higher accuracy. This accuracy improvement mainly comes from better model generalization. Codes are uploaded and maintained at Xiao-Yun Zhou's Github.

研究の動機と目的

  • 異なる正規化手法が2次元医療画像セマンティックセグメンテーションのU-Net訓練に与える影響を調査すること。
  • 特徴量の分布シフトがトレーニング中に生じる内部コホービエートシフトの問題に対処し、医療画像セグメンテーションにおいてモデル性能が低下することを解消すること。
  • 広く使用されているバッチ正規化(BN)よりも、GN、IN、LN などの代替正規化手法が、セグメンテーション精度および汎化性能において優れているかどうかを評価すること。
  • 強度分布が異なる患者特有のデータにおいて、多様な解剖的構造(RV、大動脈、LV)をカバーする形で、正規化手法の有効性を検証すること。
  • 最適な汎化および耐性戦略を特定することで、医療画像ディープラーニングにおける将来の正規化レイヤー設計を支援すること。

提案手法

  • U-Netにバッチ正規化(BN)、インスタンス正規化(IN)、レイヤー正規化(LN)、およびグループ数を変更したグループ正規化(GN4、GN8、GN16)の4つの正規化手法を適用してトレーニングした。
  • U-Netのエンコーダーおよびデコーダーの各畳み込み層の後に正規化を適用し、特徴量の分布を安定化させ、内部コホービエートシフトを低減した。
  • 右心室(RV)、大動脈、左心室(LV)のセグメンテーションを評価するために、3つの公的2次元心臓MRI/CTデータセットを用いた。
  • 主な評価指標としてDice類似係数(DSC)を用い、安定性および汎化性能を評価するために繰り返しトレーニングを実施した。
  • BNの推論挙動を、トレーニング時統計(TrainI)とテスト時統計(TestI)の両方を用いて比較し、分布シフトに対する耐性を評価した。
  • バッチサイズの影響と、複数のランダムシードを用いた正規化手法の性能評価を通じて、トレーニングの安定性を評価するためのアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ12次元医療画像セマンティックセグメンテーションのU-Net訓練において、高グループ数のグループ正規化(GN)またはインスタンス正規化(IN)は、バッチ正規化(BN)を上回る性能を示すか?
  • RQ2異なる正規化手法は、強度分布が異なる患者特有のデータにおいて、モデルの汎化性能にどのように影響を与えるか?
  • RQ3バッチサイズは、医療画像セグメンテーションのU-Netトレーニングにおける正規化手法の性能にどのような影響を及えるか?
  • RQ4推論時にトレーニング時統計(TrainI)の代わりにテスト時統計(TestI)を使用することで、BNの性能が向上するか?
  • RQ5正規化手法は、医療画像からスクラッチでトレーニングされる深層U-Netアーキテクチャにおける内部コホービエートシフトの悪影響を緩和できるか?

主な発見

  • グループ数を大きくしたグループ正規化(GN16)は、大動脈データセットで平均DSC 0.8091を達成し、BN(0.8274)およびLVデータセットでのLN(0.8189)を上回った。
  • インスタンス正規化(IN)は、右心室(RV)データセットで平均DSC 0.7035を記録し、BN(0.6436)を顕著に上回り、低コントラストな構造において最良の性能を示した。
  • GN や IN を用いることで、特に初期に精度が低かった患者(例:RVの患者31、大動脈の患者15)においても、セグメンテーション精度が著しく向上した。これは、汎化性能の向上を示している。
  • 6回の独立したトレーニングランの標準偏差は、LNが最も高く(0.0562)、GN8が最も低かった(0.0097)。これは、中程度のグループサイズのGNが、より優れたトレーニング安定性を提供することを示している。
  • 小バッチサイズが大バッチサイズよりもセグメンテーション精度で優れていた。これは、BNの性能が医療画像分野におけるバッチサイズに敏感であることを示している。
  • 推論時にトレーニング時統計(TrainI)ではなくテスト時統計(TestI)を使用することで、BNの性能が向上した。これは、BNの統計がバッチの分布シフトに敏感であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。