Skip to main content
QUICK REVIEW

[論文レビュー] LAPFormer: A Light and Accurate Polyp Segmentation Transformer

Mai Thanh Thi Nguyen, Tung Thanh Bui|arXiv (Cornell University)|Oct 10, 2022
Radiomics and Machine Learning in Medical Imaging被引用数 7
ひとこと要約

LAPFormerは、階層的Transformerエンコーダーと、段階的特徴統合、特徴精錬、選択モジュールを備えた新規CNNデコーダーを組み合わせた、軽量で高精度なTransformerベースのポリープ分類モデルである。CVC-ColonDBでは最先端の性能を達成し、5つのベンチマークでも競争力のある結果を示しており、既存のTransformerベースの手法と比較して顕著に少ないFLOPsとパラメータ数を実現している。

ABSTRACT

Polyp segmentation is still known as a difficult problem due to the large variety of polyp shapes, scanning and labeling modalities. This prevents deep learning model to generalize well on unseen data. However, Transformer-based approach recently has achieved some remarkable results on performance with the ability of extracting global context better than CNN-based architecture and yet lead to better generalization. To leverage this strength of Transformer, we propose a new model with encoder-decoder architecture named LAPFormer, which uses a hierarchical Transformer encoder to better extract global feature and combine with our novel CNN (Convolutional Neural Network) decoder for capturing local appearance of the polyps. Our proposed decoder contains a progressive feature fusion module designed for fusing feature from upper scales and lower scales and enable multi-scale features to be more correlative. Besides, we also use feature refinement module and feature selection module for processing feature. We test our model on five popular benchmark datasets for polyp segmentation, including Kvasir, CVC-Clinic DB, CVC-ColonDB, CVC-T, and ETIS-Larib

研究の動機と目的

  • ポリープ分類の課題に取り組むこと。これは、形状、サイズ、外観に著しいばらつきを示すコロノスコピー画像におけるものである。
  • Transformerのグローバルな文脈モデリング能力を活用することで、一般化性能と分類精度を向上させること。
  • 既存のTransformerベースのモデルと比較して、計算複雑性を低減しつつも高い性能を維持すること。
  • マルチスケール特徴統合と精錬モジュールを通じて、境界検出と細粒度分類を向上させること。
  • 臨床現場でのリアルタイムポリープ検出システムへの適用に適した、軽量かつ高精度なアーキテクチャを開発すること。

提案手法

  • LAPFormerは、入力のコロノスコピー画像からグローバルな文脈特徴を抽出するために階層的Transformerエンコーダーを採用している。
  • 新規のCNNベースのデコーダーは、エンコーダーの異なる段階から得られるマルチスケール特徴を統合する段階的特徴統合(PFF)モジュールを統合している。
  • デコーダーには、統合の前に特徴品質を向上させる特徴精錬モジュール(FRM)と、関連性に基づいて特徴を適応的に重み付けする特徴選択モジュール(FSM)が含まれている。
  • 低レベルのスキップ接続を組み込んで、空間的詳細を保持し、境界局所化を改善している。
  • モデルは平均プーリングとGrad-CAM可視化を用いて、分類プロセスにおける注目度と特徴の重要度を分析している。
  • アーキテクチャは、5つの公開ポリープ分類データセット上で標準のセグメンテーション損失関数を用いてエンドツーエンドで訓練されている。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドなTransformer-CNNアーキテクチャは、計算コストを低く抑えながらも、優れたポリープ分類性能を達成できるか?
  • RQ2段階的特徴統合は、マルチスケール特徴を統合するうえで、ポリープ分類にどの程度効果的か?
  • RQ3特徴精錬と選択モジュールは、分類精度と境界検出にどの程度寄与するか?
  • RQ4低レベル特徴の統合は、モデルのポリープ境界局所化能力を顕著に向上させるか?
  • RQ5標準的なポリープ分類ベンチマークにおいて、LAPFormerは最先端のTransformerベースのモデルと比較して、性能と効率の両面で優れているか?

主な発見

  • LAPFormer-SはKvasirデータセットで平均Diceスコア0.910、平均IoU 0.857を達成し、効率性の面で多数の最先端手法を上回った。
  • CVC-ColonDBでは、LAPFormer-Lが平均Diceスコア0.815、平均IoU 0.735を記録し、新たな最先端性能を樹立した。
  • LAPFormer-Lは18.96 GFLOPs、47.22Mパラメータにとどまり、ColonFormer-L(22.94 GFLOPs、52.94Mパラメータ)や他の最先端モデルと比較して顕著に少ない。
  • 特徴選択モジュール(FSM)は、すべてのデータセットで性能向上をもたらし、ETIS-Laribで最大の向上を示した(mDice +0.029、mIoU +0.033)。
  • 低レベルのスキップ接続を追加することで、境界分類が一貫して向上し、一部のデータセットではmDiceが最大0.025向上した。
  • アブレーションスタディの結果、段階的特徴統合と精錬モジュールが最適な性能を達成するために不可欠であることが確認され、各コンponentが最終的なセグメンテーション品質に顕著な寄与をしていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。