Skip to main content
QUICK REVIEW

[論文レビュー] A Multi-Branch Hybrid Transformer Networkfor Corneal Endothelial Cell Segmentation

Yinglin Zhang, Risa Higashita|arXiv (Cornell University)|May 21, 2021
Retinal Imaging and Analysis参考文献 13被引用数 10
ひとこと要約

本稿では、局所的なテクスチャとグローバルなコンテキストを捉えるために畳み込み層とトランスフォーマー・ブロックを組み合わせ、エッジ局在化と一貫性を向上させるためにボディエッジブランチを導入した、角膜内皮細胞分離のためのマルチブランチハイブリッドトランスフォーマー・ネットワーク(MBT-Net)を提案する。この手法は2つのデータセットで最先端の性能を達成し、ベースラインモデルと比較してDICEスコアを2.7%、F1スコアを1.4%向上させた。

ABSTRACT

Corneal endothelial cell segmentation plays a vital role inquantifying clinical indicators such as cell density, coefficient of variation,and hexagonality. However, the corneal endothelium's uneven reflectionand the subject's tremor and movement cause blurred cell edges in theimage, which is difficult to segment, and need more details and contextinformation to release this problem. Due to the limited receptive field oflocal convolution and continuous downsampling, the existing deep learn-ing segmentation methods cannot make full use of global context andmiss many details. This paper proposes a Multi-Branch hybrid Trans-former Network (MBT-Net) based on the transformer and body-edgebranch. Firstly, We use the convolutional block to focus on local tex-ture feature extraction and establish long-range dependencies over space,channel, and layer by the transformer and residual connection. Besides,We use the body-edge branch to promote local consistency and to provideedge position information. On the self-collected dataset TM-EM3000 andpublic Alisarine dataset, compared with other State-Of-The-Art (SOTA)methods, the proposed method achieves an improvement.

研究の動機と目的

  • 不均一な照度や運動アーチファクトの影響により、角膜内皮細胞画像のエッジがぼやけたり不規則になったりする課題に対処すること。
  • 深層学習モデルにおけるグローバルコンテキスト認識と局所的詳細の保持を統合することで、分離精度を向上させること。
  • 専用のボディエッジブランチアーキテクチャを用いてエッジ局在化を強化し、局所的一致性を促進すること。
  • 標準的なU-Netやアテンションベースのモデルが長距離依存関係や微細な詳細を捉えることのできない制限を克服すること。
  • 画像品質が低い現実世界の角膜顕微鏡画像において優れた性能を発揮すること。

提案手法

  • 局所的テクスチャ学習のための畳み込みブロックと、空間的・チャネル的・レイヤー単位の長距離依存関係をモデル化する自己注意メカニズムを組み合わせた、ハイブリッドリサidualトランスフォーマー特徴抽出モジュールを採用する。
  • ボディとエッジ特徴のための別々のブランチを備えたマルチブランチアーキテクチャを導入し、細胞内部と境界の両方の特徴を判別的に学習可能にする。
  • エンコーダ-デコーダ構造では、トランスフォーマーレイヤーを徐々に深い層に適用する選択的置換戦略を採用し、グローバルコンテキストと局所的詳細の両立をバランスさせる。
  • ボディエッジブランチは明示的にエッジマップを予測し、特徴伝搬によって一貫性を強制することで、境界局在化を向上させ、分離ノイズを低減する。
  • バイナリ・クロスエントロピー損失とDice損失を用いてエンドツーエンドで学習し、高分解能特徴を保持するためのスキップ接続を採用する。
  • アブレーションスタディを通じて、トランスフォーマーレイヤーの最適配置とボディエッジブランチの寄与度を特定し、アーキテクチャを最適化する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドトランスフォーマーと畳み込みネットワークアーキテクチャは、ぼやけたエッジを示す角膜内皮細胞の分離精度を向上させることができるか?
  • RQ2専用のボディエッジブランチの統合は、分離におけるエッジ局在化と局所的一致性にどのような影響を与えるか?
  • RQ3エンコーダ-デコーダネットワーク内におけるトランスフォーマーレイヤーの最適配置は何か?
  • RQ4グローバルコンテキストモデリングと局所的詳細保持を組み合わせることで、標準的なU-Netやアテンションベースのモデルよりも優れた性能が得られるか?
  • RQ5本手法は、不均一な照度や画像アーチファクトを含む現実世界のデータセットにおいて、どのように性能を発揮するか?

主な発見

  • TM-EM3000データセットにおいて、提案されたMBT-NetはDICEスコア0.747、F1スコア0.747を達成し、トランスフォーマーまたはボディエッジブランチを備えないベースラインと比較して、それぞれ2.7%、1.4%の向上を示した。
  • Alisarineデータセットでは、DICEスコア0.786、F1スコア0.821を達成し、比較したすべての最先端手法を上回った。
  • アブレーションスタディの結果、エンコーダーとデコーダーの最深層をトランスフォーマーに置き換えた(2-2-TR)構成が、局所的詳細とグローバルコンテキストの両立において最良のバランスを示し、全層をトランスフォーマーに置き換えた(4-4-TR)構成を上回った。
  • ボディエッジブランチ単体でも、ベースラインと比較してDICEスコアが1.1%、F1スコアが0.4%向上し、エッジ検出の有効性が裏付けられた。
  • トランスフォーマーとボディエッジブランチの組み合わせにより、特にぼやけたまたは明確でない細胞境界領域で最も顕著な性能向上が見られ、定性的な結果でもその効果が示された。
  • 本モデルは、不均一な照度や曇ったエッジを示す領域においても、ベースラインモデルが連続的かつ正確な分離を維持できなかったような困難な領域でも、頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。