Skip to main content
QUICK REVIEW

[論文レビュー] Every Annotation Counts: Multi-label Deep Supervision for Medical Image Segmentation

Simon Reiß, Constantin Seibold|arXiv (Cornell University)|Apr 27, 2021
Advanced Neural Network Applications参考文献 64被引用数 14
ひとこと要約

本論文は、ピクセル単位のマスク、バウンディングボックス、グローバルラベル、およびラベルなしデータを組み合わせた複数の監視タイプを活用する、医療画像セグメンテーションのための新規なセミ弱い教師付きディープラーニングフレームワークを提案する。新しいマルチラベルディープ監視機構と平均教師(mean-teacher)の学生・教師モデルにより、高価なピクセル単位のアノテーションの必要を94.22%削減し、完全教師ありベースラインの95%の性能を、わずか5.78%の強力ラベルで達成した。

ABSTRACT

Pixel-wise segmentation is one of the most data and annotation hungry tasks in our field. Providing representative and accurate annotations is often mission-critical especially for challenging medical applications. In this paper, we propose a semi-weakly supervised segmentation algorithm to overcome this barrier. Our approach is based on a new formulation of deep supervision and student-teacher model and allows for easy integration of different supervision signals. In contrast to previous work, we show that care has to be taken how deep supervision is integrated in lower layers and we present multi-label deep supervision as the most important secret ingredient for success. With our novel training regime for segmentation that flexibly makes use of images that are either fully labeled, marked with bounding boxes, just global labels, or not at all, we are able to cut the requirement for expensive labels by 94.22% - narrowing the gap to the best fully supervised baseline to only 5% mean IoU. Our approach is validated by extensive experiments on retinal fluid segmentation and we provide an in-depth analysis of the anticipated effect each annotation type can have in boosting segmentation performance.

研究の動機と目的

  • 専門家によるピクセル単位のマスクアノテーションが時間と労力を要し、希少である医療画像セグメンテーションにおける高いアノテーションコストに対処すること。
  • 標準的な弱い教師付きまたはセミ教師付き学習の限界を克服し、ピクセル単位のラベル、バウンディングボックス、グローバルラベル、およびラベルなしデータといった多様な監視信号を、1つのトレーニングフレームワークに統合すること。
  • 低データ環境下での学習を安定化させ、ディープ監視と疑似ラベル化を用いて一般化性能を向上させる、頑健なトレーニング制度を開発すること。
  • 低ショット設定において、ネットワークの下流層にディープ監視を統合することが性能に顕著な影響を与えることを示すこと。

提案手法

  • ピクセル単位のマスク、バウンディングボックス、グローバルラベル、およびラベルなしデータを統合する、新たなディープ監視の定式化であるマルチラベルディープ監視を導入。この手法では、マルチラベル交差エントロピー損失を用いて、セグメンテーションネットワークの中間層に監視信号を注入する。
  • 平均教師(mean-teacher)の学生・教師モデルを適用し、ラベルなしおよび弱いラベル付き画像に対して頑健な疑似ラベルを生成することで、モデルの一般化性能を向上させる。
  • 完全ラベル付きデータ、バウンディングボックス、グローバルラベル、およびラベルなしデータを一度に扱える、柔軟なトレーニングパイプラインを設計。1つのエンドツーエンドのトレーニングプロセスで、混合監視をサポートする。
  • 反復的トレーニングを実施し、複数のデータ分割と標準偏差の報告を用いることで、低データシナリオにおける安定的かつ再現可能な評価を保証する。
  • 最終出力だけでなく、低解像度で深い層に対してもディープ監視を統合することで、特徴学習と勾配伝播を改善する。
  • ピクセル単位のアノテーションが不足する状況でも、修正されたMILに類似たアプローチによりグローバル画像レベルのラベルを活用し、モデルの指導を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位のラベル、バウンディングボックス、グローバルラベル、およびラベルなしデータといった、複数のタイプの弱いおよび部分的な監視信号を、1つのセグメンテーショントレーニングフレームワークに効果的に統合する方法は何か?
  • RQ2低データ環境下におけるセグメンテーション性能に、ネットワークの下流層にディープ監視を統合することが与える影響は何か?
  • RQ3マルチラベルディープ監視と組み合わせた平均教師モデルによる疑似ラベル化は、医療画像セグメンテーションにおいて顕著な性能向上をもたらすか?
  • RQ4モデルの性能を損なわずに、高価なピクセル単位のアノテーションの数をどの程度まで削減できるか?

主な発見

  • Cirrusデータセットにおいて、全ピクセルマスクのうちわずか5.78%(平均415.5枚中24枚)のアノテーションで、提案手法であるMean-Taught Deep Supervisionモデルが45.85%のmIoUを達成。完全教師ありベースライン性能の95%に達した。
  • 完全教師ありベースラインと比較して、高価なピクセル単位のアノテーションの必要量を94.22%削減し、性能の差を著しく縮小した。
  • マルチラベルディープ監視は、標準的な交差エントロピー監視と比較して、異なるデータ環境下でmIoUを3.18%から7.57%まで向上させた。
  • ピクセル単位のマスクとグローバルラベルがわずか6つしかない状況でも、本手法は完全なバウンディングボックスアノテーションで学習したモデルを上回った。これにより、提案された監視信号統合の有効性が示された。
  • 10回のトレーニングスプリットを用いた場合、Cirrusでは35.82%、Topconでは45.85%のmIoUを達成。異なるOCTスキャナーメーカー間での一般化性能が強く示された。
  • アブレーションスタディにより、下流層におけるディープ監視が極めて重要であることが確認された。これがないと、特に低ショット設定において性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。