Skip to main content
QUICK REVIEW

[論文レビュー] Depth Anything in Medical Images: A Comparative Study

John Han, Ayberk Acar|arXiv (Cornell University)|Jan 29, 2024
AI in cancer detection被引用数 4
ひとこと要約

本研究では、医療内視鏡および腹腔鏡画像におけるDepth Anythingの基礎モデルのゼロショット性能を、一般シーンおよびドメイン内単眼深度推定(MDE)モデルと比較して評価する。強力なゼロショット能力を示すが、精度や速度において一貫して先行モデルを上回るとは限らず、特定の解剖的領域ではドメイン内モデル(Endo-Depth や MiDaS)が優れた結果を示す。一方、Depth Anythingはリアルタイム応用に適した良好な推論速度を提供する。

ABSTRACT

Monocular depth estimation (MDE) is a critical component of many medical tracking and mapping algorithms, particularly from endoscopic or laparoscopic video. However, because ground truth depth maps cannot be acquired from real patient data, supervised learning is not a viable approach to predict depth maps for medical scenes. Although self-supervised learning for MDE has recently gained attention, the outputs are difficult to evaluate reliably and each MDE's generalizability to other patients and anatomies is limited. This work evaluates the zero-shot performance of the newly released Depth Anything Model on medical endoscopic and laparoscopic scenes. We compare the accuracy and inference speeds of Depth Anything with other MDE models trained on general scenes as well as in-domain models trained on endoscopic data. Our findings show that although the zero-shot capability of Depth Anything is quite impressive, it is not necessarily better than other models in both speed and performance. We hope that this study can spark further research in employing foundation models for MDE in medical scenes.

研究の動機と目的

  • 医療内視鏡および腹腔鏡画像におけるDepth Anythingの基礎モデルのゼロショット一般化性能を評価すること。
  • 一般シーンMDEモデル(MiDaS、ZoeDepth)およびドメイン内モデル(Endo-SfM、Endo-Depth)と比較して、Depth Anythingの精度および推論速度を評価すること。
  • Depth Anythingのような基礎モデルが、微調整なしに多様な解剖的構造に一貫して一般化できるかを評価すること。
  • 今後の研究における基礎モデルを用いた医療分野の単眼深度推定のベンチマークを提供すること。
  • 事前学習済み基礎モデルを用いたリアルタイム手術ナビゲーションおよび3次元再構築の実現可能性を検討すること。

提案手法

  • 本研究では、EndoSLAMおよび補正済みHamlynデータセットという2つの公開医療データセットを用い、Depth Anything、MiDaS、ZoeDepth、Endo-SfM、Endo-Depth、LapDepthの各モデルを評価する。
  • 医療データに対する微調整なしに、各モデルの元の事前学習済み重みを用いてゼロショット推論を実施する。
  • 定量的指標には、絶対相対誤差(Abs. Rel.)、二乗相対誤差(Sq. Rel.)、平均二乗誤差(RMSE)、およびδ1(δ1)を用い、深度精度を評価する。
  • 推論速度は、Intel i9-13900K CPUおよびNVIDIA RTX 4090 GPUを用い、入力解像度(320, 320)で測定する。
  • 大腸、小腸、胃、直腸という4つの解剖的領域を代表するシーケンスを対象に、性能を分析する。
  • モデル間の比較を通じて、精度と速度のトレードオフを明らかにし、Hamlynデータセットにおける不完全な真値ラベルによる制限要因についても議論する。

実験結果

リサーチクエスチョン

  • RQ1Depth Anythingの基礎モデルは、一般シーンMDEモデルと比較して、医療内視鏡画像において優れたゼロショット性能を達成するか?
  • RQ2Depth Anythingのゼロショット性能は、内視鏡データに特化して訓練されたドメイン内MDEモデルと比較してどうか?
  • RQ3Depth Anythingの推論速度は他のMDEモデルと比較してどの程度か?また、リアルタイム手術ナビゲーションシステムに適しているか?
  • RQ4公開医療データセットにおける真値深度マップの不完全さが、性能評価の信頼性にどの程度影響を及えるか?
  • RQ5Depth Anythingのような基礎モデルは、微調整なしに多様な解剖的構造に効果的に一般化できるか?

主な発見

  • EndoSLAMデータセットでは、大腸シーケンスでMiDaSがDepth Anythingを上回り、小腸シーケンスではEndo-SfMLearnerおよびMiDaSがすべてのDepth Anythingバリアントを上回った。
  • 胃シーケンスでは、DAM-Largeが全モデルの中で最高の精度を示し、Abs. Rel.は0.078、δ1は0.953であった。
  • 補正済みHamlynデータセットでは、ZoeDepthとDepth Anything-Indoor/Outdoorが同等の性能を示し、シーケンス1ではZoeDepthがAbs. Rel. 0.083、δ1 0.949を達成した。
  • Endo-Depthが最も高速で、同じハードウェア上での推論速度は249.38 FPSを記録し、最小のDepth Anythingバリアント(120.34 FPS)をも上回った。
  • ZoeDepthは最も遅い推論時間(82.15 ms、12.17 FPS)を示したが、依然として手術用途におけるリアルタイム性能を満たしていた。
  • Hamlynデータセットの真値深度マップは不完全であることが判明し、特にシーケンス4、19、20において性能比較の信頼性に影響を及ぼす可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。