Skip to main content
QUICK REVIEW

[論文レビュー] m2caiSeg: Semantic Segmentation of Laparoscopic Images using Convolutional Neural Networks

Salman Maqbool, Aqsa Riaz|arXiv (Cornell University)|Aug 23, 2020
Surgical Simulation and TrainingMedicine参考文献 34被引用数 18
ひとこと要約

本稿では、自己教師あり事前学習とデータ拡張を用いたU-Netベースのエンコーダデコーダ畳み込みニューラルネットワークを備えた、腹腔鏡手術画像のセマンティックセグメンテーションのための新規データセットm2caiSegを提案する。この手法は、臓器と手術器具を統合して分類する際、F1スコア0.57を達成し、自律的ロボット手術への基盤的段階としての可能性を示している。

ABSTRACT

Autonomous surgical procedures, in particular minimal invasive surgeries, are the next frontier for Artificial Intelligence research. However, the existing challenges include precise identification of the human anatomy and the surgical settings, and modeling the environment for training of an autonomous agent. To address the identification of human anatomy and the surgical settings, we propose a deep learning based semantic segmentation algorithm to identify and label the tissues and organs in the endoscopic video feed of the human torso region. We present an annotated dataset, m2caiSeg, created from endoscopic video feeds of real-world surgical procedures. Overall, the data consists of 307 images, each of which is annotated for the organs and different surgical instruments present in the scene. We propose and train a deep convolutional neural network for the semantic segmentation task. To cater for the low quantity of annotated data, we use unsupervised pre-training and data augmentation. The trained model is evaluated on an independent test set of the proposed dataset. We obtained a F1 score of 0.33 while using all the labeled categories for the semantic segmentation task. Secondly, we labeled all instruments into an 'Instruments' superclass to evaluate the model's performance on discerning the various organs and obtained a F1 score of 0.57. We propose a new dataset and a deep learning method for pixel level identification of various organs and instruments in a endoscopic surgical scene. Surgical scene understanding is one of the first steps towards automating surgical procedures.

研究の動機と目的

  • 自律的ロボット手術における手術シーン理解の重要な課題に応えるために、臓器と手術器具のピクセル単位の識別を可能にする。
  • 学習と評価のための307枚のアノテート済み腹腔鏡画像を備えた、公開可能な新規データセットm2caiSegを構築する。
  • 教師なし事前学習とデータ拡張を用いることで、限られたアノテート済みデータでも一般化性能の高いディープラーニングベースのセマンティックセグメンテーションフレームワークを開発する。
  • 安全性が求められる応用分野を念頭に、将来の腹腔鏡シーンセグメンテーション研究のためのベースラインパフォーマンスを確立する。
  • データセットとコードの公開を通じて、再現可能性を促進し、コミュニティの進展を支援する。

提案手法

  • 腹腔鏡画像における臓器と手術器具のピクセル単位のセグメンテーションを実行する、U-Net風のエンコーダデコーダ畳み込みニューラルネットワークアーキテクチャを提案する。
  • ImageNetデータセットを用いて再構成損失による自己教師あり事前学習を実施し、m2caiSegデータセットでのファインチューニング前に汎用的な特徴を学習する。
  • データ不足を緩和し、モデルのロバスト性を向上させるために、ランダムクロッピング、反転、カラーのジャミングを含む広範なデータ拡張技術を採用する。
  • 交差エントロピー損失とコサインスケジュールを用いたアダム最適化法を用いて、m2caiSegデータセット上で事前学習モデルをファインチューニングする。
  • 標準的なセグメンテーション指標(交差率(IoU)、精度、再現率、F1スコア)を用いて、ホールドアウトされたテストセット上でモデルを評価する。
  • 転移学習の実験として、m2caiSegモデルをEndoVis 2018ロボットシーンセグメンテーションデータセットでファインチューニングし、一般化能力を評価する。

実験結果

リサーチクエスチョン

  • RQ1手術画像の低データ環境において、自己教師あり事前学習がセマンティックセグメンテーション性能を向上させるか?
  • RQ2限られたが多様な腹腔鏡画像データセット上で学習したディープラーニングモデルが、未観測の手術シーンにどの程度一般化できるか?
  • RQ3細かく分類された構造(例:手術器具)や小さな解剖的特徴(例:針や糸)を区別するセグメンテーションモデルの性能はいかがなものか?
  • RQ4複雑でごちゃついた手術シーンにおいて、提案アーキテクチャが空間的詳細と境界をどの程度保持できるか?
  • RQ5m2caiSegで学習したモデルは、最小限のファインチューニングで他の手術データセット(例:EndoVis 2018)に一般化できるか?

主な発見

  • m2caiSegデータセットにおける10種類の臓器と手術器具を分類する際、F1スコアは0.33にとどまり、細分化されたセグメンテーションにおいて中程度の性能であることが示された。
  • 手術器具を1つの「Instruments」スーパークラスに統合した場合、F1スコアは0.57に向上し、より広いカテゴリでの一般化性能の向上が確認された。
  • EndoVis 2018データセットにおいて、背景と組織クラスのIoU(0.876)とF1(0.934)は非常に高く、主な構造物に対して優れた性能を示した。
  • 針、糸、クランプなどの小さなまたはレアなオブジェクトでは性能が著しく低下し、F1スコアは0.000にとどまり、微細な詳細の検出における限界が浮き彫りになった。
  • ファインチューニング後、m2caiSegモデルはEndoVis 2018データセットに妥当に一般化され、主なクラス(例:器具シャフト、被覆腎臓)のF1スコアは0.80以上を達成した。
  • 結果から、限られたアノテート済みデータでも、自己教師あり事前学習 followed by ファインチューニングのアプローチが、手術シーンセグメンテーションに有効であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。