Skip to main content
QUICK REVIEW

[論文レビュー] Dense Depth Estimation in Monocular Endoscopy with Self-supervised Learning Methods

Xingtong Liu, Ayushi Sinha|arXiv (Cornell University)|Feb 20, 2019
Advanced Vision and Imaging参考文献 29被引用数 7
ひとこと要約

本論文は、ラベルなしの内視鏡動画と構造から姿勢を求める(SfM)から得られるスパarsな3D再構成のみを必要とし、手動ラベリング、CTスキャン、光度一定性仮定なしに、単眼内視鏡における高密度深度推定のための自己教師あり深層学習手法を提案する。この手法は、クロス・ペイティエント評価において1ミリメートル未満の平均残差誤差を達成し、生体内副鼻腔内視鏡データにおいて既存の自己教師あり手法を上回る性能を発揮する。

ABSTRACT

We present a self-supervised approach to training convolutional neural networks for dense depth estimation from monocular endoscopy data without a priori modeling of anatomy or shading. Our method only requires monocular endoscopic videos and a multi-view stereo method, e.g., structure from motion, to supervise learning in a sparse manner. Consequently, our method requires neither manual labeling nor patient computed tomography (CT) scan in the training and application phases. In a cross-patient experiment using CT scans as groundtruth, the proposed method achieved submillimeter mean residual error. In a comparison study to recent self-supervised depth estimation methods designed for natural video on in vivo sinus endoscopy data, we demonstrate that the proposed approach outperforms the previous methods by a large margin. The source code for this work is publicly available online at https://github.com/lppllppl920/EndoscopyDepthEstimation-Pytorch.

研究の動機と目的

  • 手動ラベリングや術前CTスキャンに依存しない、単眼内視鏡における自己教師あり深度推定手法の開発を目的とする。
  • 低テクスチャ、鏡面反射、組織変形のためのスパースで一貫性のない深度再構成の課題に対処することを目的とする。
  • 光度一定性や解剖学的事前知識を必要とせず、正確な3D再構成を実現し、手術ナビゲーションに応用することを目的とする。
  • ラベルなしの動画データのみを用いて、異なる患者や内視鏡カメラ間で一般化可能な手法を実現することを目的とする。
  • 光度類似性に依存しない幾何的整合性損失を導入することで、SfMの誤差に対する耐性を高めることを目的とする。

提案手法

  • 本手法は、構造から姿勢を求める(SfM)によって生成されたスパース3D再構成から導出される教師ありおよび自己教師あり損失を組み合わせて、畳み込みニューラルネットワークを訓練する。
  • 連続フレームの予測深度マップ間の剛体変換を強制する、新規の微分可能な幾何的整合性損失(DCL)を導入し、低テクスチャまたは鏡面反射領域における一般化性能を向上させる。
  • 2番目の損失として、SfMから得られるスパース深度点を活用するスパース特徴損失(SFL)を導入し、密度のある真値ラベルを必要とせずにネットワークを監視する。
  • SFLとDCLを組み合わせたマルチタスク損失を用いて、ネットワークをエンドツーエンドで訓練し、単一のモノクロナルフレームから高密度深度推定を可能にする。
  • 本手法はフレーム間の光度一定性を仮定しないため、内視鏡で一般的な照明の変化や鏡面反射に対して耐性がある。
  • 訓練プロセスは完全に自己教師ありであり、モノクロナル動画とSfM出力のみに依存し、手動アノテーションやCTスキャンの必要がない。

実験結果

リサーチクエスチョン

  • RQ1手動ラベリングや術前CTスキャンなしに、単眼内視鏡における高密度深度推定を達成できるか?
  • RQ2光度一定性が成り立たない状況下で、連続フレーム間の幾何的整合性をどのように強制できるか?
  • RQ3ラベルなしの動画データのみを用いて、自己教師あり深層学習モデルが異なる患者や内視鏡カメラ間で一般化できるか?
  • RQ4本手法は、実際の生体内内視鏡データにおいて、既存の自己教師あり深度推定技術と比較してどのように優れているか?
  • RQ5DCLのような幾何的整合性損失は、鏡面反射や低テクスチャ環境において、どの程度深度推定の性能を向上させられるか?

主な発見

  • CTスキャンを真値として用いたクロス・ペイティエント評価において、本手法は1ミリ未塔の平均残差誤差を達成し、患者間での一般化性能が優れていることを示した。
  • 生体内副鼻腔内視鏡データにおいて、2つの最近の自己教師あり深度推定手法を大きく上回り、優れた耐性と精度を示した。
  • 微分可能な幾何的整合性損失(DCL)の導入により、境界付近や鏡面領域などSfM点が欠落または不正確な領域での性能が顕著に向上した。
  • 最小限のファインチューニングで、異なる内視鏡カメラや患者間での一般化性能が良好であることが、クロス・ペイティエント実験で示された。
  • モデルはグローバルスケールまで高密度深度マップを生成でき、著者らはアプリケーションにおいて外部キャリブレーションや既知のサイズの物体を用いることでグローバルスケール回復が可能であると指摘している。
  • 最近接点ペアリングの性質から、CTベースの残差誤差評価は真の誤差を低く見積もっている可能性があるため、有効なスパース対応がある領域ではSfMベースの評価の方が正確性をよりよく反映している可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。