[論文レビュー] Rethinking Boundary Detection in Deep Learning Models for Medical Image Segmentation
本論文では、畳み込みニューラルネットワーク(CNN)、ビジョン Transformer(ViT)、および明示的な境界検出オペレータを統合することで、セグメンテーション精度と境界局在化を向上させる新規な医療画像セグメンテーションネットワーク CTO を提案する。長距離依存性を捉えるために軽量な ViT を用いたデュアルストリームエンコーダと、自己生成された境界マスクを明示的监督として用いる境界ガイドドデコーダを採用することで、6つの医療画像データセットにおいて最先端の性能を達成し、計算効率も競争的である。
Medical image segmentation is a fundamental task in the community of medical image analysis. In this paper, a novel network architecture, referred to as Convolution, Transformer, and Operator (CTO), is proposed. CTO employs a combination of Convolutional Neural Networks (CNNs), Vision Transformer (ViT), and an explicit boundary detection operator to achieve high recognition accuracy while maintaining an optimal balance between accuracy and efficiency. The proposed CTO follows the standard encoder-decoder segmentation paradigm, where the encoder network incorporates a popular CNN backbone for capturing local semantic information, and a lightweight ViT assistant for integrating long-range dependencies. To enhance the learning capacity on boundary, a boundary-guided decoder network is proposed that uses a boundary mask obtained from a dedicated boundary detection operator as explicit supervision to guide the decoding learning process. The performance of the proposed method is evaluated on six challenging medical image segmentation datasets, demonstrating that CTO achieves state-of-the-art accuracy with a competitive model complexity.
研究の動機と目的
- CNN が長距離依存性を捉えることの制限と、ViT が並進不変性と局所的特徴学習を欠いている点を是正する。
- 暗黙的な学習に依存するのではなく、明示的な境界監視を導入することで、医療画像セグメンテーションにおける境界局在化を改善する。
- 従来の最先端アーキテクチャと比較して、セグメンテーション精度とモデル効率のより良いトレードオフを達成する。
- 多様な医療画像処理タスクにおける、CNN、ViT、境界オペレータの統合が可能な統一されたエンコーダデコーダフレームワークの有効性を検証する。
提案手法
- CTO はデュアルストリームエンコーダを採用:局所的特徴抽出のための標準的な CNN バックボーンと、長距離空間的依存性をモデル化するための軽量なビジョン Transformer(ViT)ブランチ。
- 境界検出オペレータは中間特徴マップから高品質な境界マスクを生成し、追加のアノテーションを必要とせずに明示的監視を提供する。
- 境界ガイドドデコーダは、自己生成された境界マスクを補助的監視として用い、特に輪郭の正確性を向上させる予測を精緻化する。
- モデルは標準的なエンコーダデコーダアーキテクチャに従い、スキップ接続により空間的詳細が保持され、特徴の融合が強化される。
- 境界強化モジュール(BEM)と境界インジェクションモジュール(BIM)を導入し、境界監視をデコーディングプロセスに効果的に統合する。
- アブレーションスタディにより、各コンポonentの累積的寄与が確認され、特に境界インジェクション機構が最大のパフォーマンス向上をもたらした。

実験結果
リサーチクエスチョン
- RQ1明示的な境界監視は、ぼやけたまたは不規則な境界を示す臓器において、セグメンテーション精度を顕著に向上させるか?
- RQ2デュアルストリームエンコーダアーキテクチャで CNN と ViT を組み合わせることで、医療画像セグメンテーションにおける特徴表現とモデル効率にどのような影響を与えるか?
- RQ3中間特徴から自己生成された境界マスクが、追加のアノテーションを必要とせずに性能にどの程度向上をもたらすか?
- RQ4境界ガイドドデコーダの統合は、標準的なデコーダ設計と比較して、より正確な輪郭の明示をもたらすか?
- RQ5CTOアーキテクチャ全体のパフォーマンス向上における、各コンポonent(CNN、ViT、境界オペレータ)の相対的寄与度はどの程度か?
主な発見
- ISIC 2018 では、Dice 91.21%、IoU 84.45% を達成し、前回の SOTA よりそれぞれ 2.89 パーセンテージポイント、2.94 パーセンテージポイント高い性能を示した。
- CoNIC では、Dice 79.77%、IoU 66.42%、PQ 65.58% を達成し、比較されたすべての手法を上回った。
- LiTS17 では、Dice 91.50%、IoU 84.59% を達成し、SOTA よりそれぞれ 0.26 パーセンテージポイント、0.45 パーセンテージポイント高い性能を示した。
- BTCV では、Dice 81.10%、HD 18.75% を達成し、2番目に良い手法より Dice で 1.98 パーセンテージポイント高い性能を示した。
- アブレーションスタディでは、境界インジェクションモジュール(BIM)を追加するだけで Dice が 2.89 パーセンテージポイント向上し、その重要性が裏付けられた。
- 定性的な結果から、CTO は特に CoNIC および ISIC データセットのぼやけたまたは小さな核において、より正確で滑らかな物体の輪郭を生成することが確認された。
![Figure 2: Visualizations on CoNIC [ 17 ] (top two rows) and LiTS17 [ 4 ] (buttom two rows). The red boxes highlight the main difference of each method.](https://ar5iv.labs.arxiv.org/html/2305.00678/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。