Skip to main content
QUICK REVIEW

[論文レビュー] SLAM Endoscopy enhanced by adversarial depth prediction

Richard J. Chen, Taylor L. Bobrow|arXiv (Cornell University)|Jun 29, 2019
Colorectal Cancer Screening and Detection参考文献 13被引用数 21
ひとこと要約

本論文は、条件付き生成対抗ネットワーク(cGAN)を用いた敵対的深度推定により、RGB内視鏡画像から深度を推定する単眼SLAMシステムを提案する。合成およびドメインランダマイズされたフォトレアリスト的CTレンダリング腸画像で学習された手法により、フィジカルモデルおよび生体外豚腸モデルの高密度3D再構成が可能となり、鏡面反射や特徴の乏しさにもかかわらず、安定したトラッキングを実現した。

ABSTRACT

Medical endoscopy remains a challenging application for simultaneous localization and mapping (SLAM) due to the sparsity of image features and size constraints that prevent direct depth-sensing. We present a SLAM approach that incorporates depth predictions made by an adversarially-trained convolutional neural network (CNN) applied to monocular endoscopy images. The depth network is trained with synthetic images of a simple colon model, and then fine-tuned with domain-randomized, photorealistic images rendered from computed tomography measurements of human colons. Each image is paired with an error-free depth map for supervised adversarial learning. Monocular RGB images are then fused with corresponding depth predictions, enabling dense reconstruction and mosaicing as an endoscope is advanced through the gastrointestinal tract. Our preliminary results demonstrate that incorporating monocular depth estimation into a SLAM architecture can enable dense reconstruction of endoscopic scenes.

研究の動機と目的

  • 特徴が乏しく、深度センシングが欠落している単眼内視鏡SLAMにおける正確な3D再構成の課題に対処すること。
  • 組織の均一性、変形、鏡面反射のため、従来の特徴ベースSLAMに制限がある内視鏡分野における課題を克服すること。
  • 敵対的学習を用いて、患者特有のテクスチャーや色の変動に一般化可能な深度推定手法を開発すること。
  • 単眼RGB動画と予測深度のみを用いて、高密度なサーフェルベース再構成を実現すること。
  • 手術手順の品質指標向上と病変の局在化を目的とした、内視鏡シーンのモザイキングフレームワークを提供すること。

提案手法

  • 最小-最大損失目的関数を用いて、条件付き生成対抗ネットワーク(cGAN)を訓練し、単眼RGB内視鏡画像から深度を予測する。
  • 初期学習データとして、真値深度マップを備えた単純な腸モデルの合成的映像(映画風レンダリング)を用いる。
  • ヒト腸のCTスキャンから生成されたドメインランダマイズドフォトレアリスト的画像を用いて、深度ネットワークをファインチューニングする。
  • 視覚的リアリズムと精度の向上を図るため、敵対的損失(L_GAN)とL1ピクセル単位損失を組み合わせる。
  • 予測された深度マップとRGB画像を統合し、ElasticFusion SLAMフレームワークに組み込んで、直接的で高密度なサーフェルベース再構成を実現する。
  • ハードウェア改造なしの単眼カメラセットアップを採用し、困難な内視鏡的条件下でもリアルタイムで安定したトラッキングを実現する。

実験結果

リサーチクエスチョン

  • RQ1単眼内視鏡画像からの敵対的深度推定は、特徴が乏しく、鏡面反射があり、変形が生じる環境下でも3D再構成の正確性を向上させることができるか?
  • RQ2ドメインランダマイズは、実内視鏡組織への一般化を向上させる深度推定ネットワークの効果を高めるか?
  • RQ3GANベースの深度ネットワークは、消化管内での組織の色、テクスチャー、鏡面反射の変動にどの程度耐性を示せるか?
  • RQ4単眼RGBと予測深度のみを用いて、ステレオや深度センサが不要な高密度サーフェルベース再構成が可能か?
  • RQ5本手法は、従来の特徴ベースSLAMと比較して、トラッキングの安定性と再構成品質の点で優れているか?

主な発見

  • 提案手法は、フィジカルモデルの腸に対して高密度な3D再構成を達成し、ハウストラルフォールドやフィducialマーカーを正確に捉えた。
  • 生体外豚腸モデルでは、照明の動的な変化や鏡面反射にもかかわらず、システムがトラッキングを維持し、サーフェルの再着色に成功した。
  • ファインチューニング段階でのドメインランダマイズにより、敵対的深度ネットワークはテクスチャーと色の変動に対して強靭性を示した。
  • ハードウェア改造なしで、内視鏡動画シーケンスを一貫した3D表面モデルにモザイキングするフレームワークを実現した。
  • 再構成品質は、フィジカルモデルおよび実組織モデルの両方で定性的に検証されたが、定量的検証は保留中である。
  • 本手法は、病変の局在化の向上や手術の完全性評価(例:表面積カバレッジ)といった、臨床的応用の可能性を有している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。