[論文レビュー] DDNet: Cartesian-polar Dual-domain Network for the Joint Optic Disc and Cup Segmentation
本稿では、直交座標系からの並進不変特徴と極座標系からの回転不変特徴を、二重ドメイン統合モジュールを介して統合することで、網膜後極部画像における視神経乳頭および視杯の同時セグメンテーションを実現するDDNetという、直交座標・極座標の二重ドメイン畳み込みニューラルネットワークを提案する。DDNetはORIGAデータセットで最先端の性能を達成し、縦方向の視杯対視神経乳頭径比(CDR)推定誤差を0.0641まで低減した。これは、緑内障スクリーニングにおける強力な潜在的応用を示している。
Existing joint optic disc and cup segmentation approaches are developed either in Cartesian or polar coordinate system. However, due to the subtle optic cup, the contextual information exploited from the single domain even by the prevailing CNNs is still insufficient. In this paper, we propose a novel segmentation approach, named Cartesian-polar dual-domain network (DDNet), which for the first time considers the complementary of the Cartesian domain and the polar domain. We propose a two-branch of domain feature encoder and learn translation equivariant representations on rectilinear grid from Cartesian domain and rotation equivariant representations on polar grid from polar domain parallelly. To fuse the features on two different grids, we propose a dual-domain fusion module. This module builds the correspondence between two grids by the differentiable polar transform layer and learns the feature importance across two domains in element-wise to enhance the expressive capability. Finally, the decoder aggregates the fused features from low-level to high-level and makes dense predictions. We validate the state-of-the-art segmentation performances of our DDNet on the public dataset ORIGA. According to the segmentation masks, we estimate the commonly used clinical measure for glaucoma, i.e., the vertical cup-to-disc ratio. The low cup-to-disc ratio estimation error demonstrates the potential application in glaucoma screening.
研究の動機と目的
- 2次元網膜画像に深さの手がかりが欠如しているため、単一ドメインのディーブラーニングでは視杯および視神経乳頭のセグメンテーションに限界が生じることを解決すること。
- 直交座標系と極座標系の両方から得られる補完的文脈的情報を活用し、セグメンテーション性能の向上を図ること。
- 直交座標系からの並進不変特徴と極座標系からの回転不変特徴を統合することで表現学習を強化する手法の開発。
- ORIGAデータセット上で手法を評価し、縦方向の視杯対視神経乳頭径比(CDR)推定を通じて臨床的有用性を検証すること。
提案手法
- 2本のブランチエンコーダーを設計:1つは直交座標系で並進不変特徴学習を実行するためのもの、もう1つは極座標系で回転不変特徴学習を実行するためのもの。
- 直交グリッドと極座標グリッド間の空間的対応関係を確立するため、微分可能極座標変換レイヤーを導入。
- ドメイン間の要素ごとの特徴重要度を学習する二重ドメイン統合モジュールを提案し、表現能力を向上。
- 多段階の統合特徴を集約して密度付きセグメンテーション予測を実行するデコーダーを用いる。
- 視神経乳頭および視杯セグメンテーションの共同最適化を図るため、二値交差エントロピー損失とDice損失の組み合わせでネットワークを訓練。
- セグメンテーションマスクを適用して臨床的評価のための縦方向視杯対視神経乳頭径比(CDR)を計算。
実験結果
リサーチクエスチョン
- RQ1直交座標系と極座標系の両ドメインからの特徴を統合することで、単一ドメイン手法と比較して視神経乳頭および視杯のセグメンテーション精度が向上するか?
- RQ2並進不変特徴と回転不変特徴の統合は、不適切に定式化されたセグメンテーションタスクにおける特徴表現をどのように向上させるか?
- RQ3提案された二重ドメイン統合機構は、既存の最先端モデルと比較して、セグメンテーションの重複度と境界局在精度において優れているか?
- RQ4向上したセグメンテーションは、緑内障リスク評価のための臨床的指標(縦方向視杯対視神経乳頭径比:CDR)の精度向上にどの程度寄与するか?
主な発見
- DDNetは、ORIGAデータセットにおいて、すべてのベースラインと比較して視神経乳頭(E_disc)、視杯(E_cup)、リム(E_rim)の重複誤差が最小である。
- MNet(先行の最先端手法)と比較して、視神経乳頭、視杯、リムの各重複誤差をそれぞれ1.7%、2.6%、3.2%低減した。
- MNetと比較して、視神経乳頭および視杯の境界位置誤差(BLE)をそれぞれ1.44および1.9低減した。
- DDNetは、直交座標系および極座標系の両ドメインでDeepLabv3+を上回り、視神経乳頭、視杯、リムの重複誤差をそれぞれ0.5%、0.5%、1.1%低減した。
- DDNetは、CDR推定誤差が0.0641と最小であり、DeepLabv3+(直交座標系:0.0671、極座標系:0.0668)およびMNet(0.071)を上回った。
- 他のモデルが視杯を正確にセグメンテーションできない困難なケースに対しても、本手法は頑健であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。