Skip to main content
QUICK REVIEW

[論文レビュー] EndoNet: A Deep Architecture for Recognition Tasks on Laparoscopic Videos

Andru Putra Twinanda, Sherif Shehata|arXiv (Cornell University)|Feb 9, 2016
Colorectal Cancer Screening and Detection参考文献 13被引用数 5
ひとこと要約

EndoNetは、視覚的情報のみを用いて腹腔鏡胆嚢切除術動画におけるフェーズ認識とツール存在検出を同時に実行する、新しい深層畳み込みニューラルネットワーク(CNN)アーキテクチャである。特徴量を自動で学習することで、手作業で設計された特徴量や、正例アノテーションから導出されたバイナリーツール信号を上回る最先端の性能を達成している。

ABSTRACT

Surgical workflow recognition has numerous potential medical applications, such as the automatic indexing of surgical video databases and the optimization of real-time operating room scheduling, among others. As a result, phase recognition has been studied in the context of several kinds of surgeries, such as cataract, neurological, and laparoscopic surgeries. In the literature, two types of features are typically used to perform this task: visual features and tool usage signals. However, the visual features used are mostly handcrafted. Furthermore, the tool usage signals are usually collected via a manual annotation process or by using additional equipment. In this paper, we propose a novel method for phase recognition that uses a convolutional neural network (CNN) to automatically learn features from cholecystectomy videos and that relies uniquely on visual information. In previous studies, it has been shown that the tool signals can provide valuable information in performing the phase recognition task. Thus, we present a novel CNN architecture, called EndoNet, that is designed to carry out the phase recognition and tool presence detection tasks in a multi-task manner. To the best of our knowledge, this is the first work proposing to use a CNN for multiple recognition tasks on laparoscopic videos. Extensive experimental comparisons to other methods show that EndoNet yields state-of-the-art results for both tasks.

研究の動機と目的

  • 手作業で設計された視覚的特徴量や、手動でアノテートされたツール信号の限界を解消すること。
  • 生の腹腔鏡動画フレームから、判別性の高い視覚的特徴量を自動で学習する深層学習フレームワークの開発。
  • 1つのCNNアーキテクチャを用いて、フェーズ認識とツール存在検出を同時に学習するマルチタスク学習の実現。
  • ベンチマーク用に、大規模かつ公開可能なデータセット(Cholec80)の構築。
  • Cholec80およびEndoVisデータセットの両方で評価することで、一般化性と頑健性の検証。

提案手法

  • フェーズ認識とツール存在検出のマルチタスク学習を目的とした、独自に設計されたCNNアーキテクチャ「EndoNet」の提案。
  • 手作業による記述子を一切用いずに、生の動画フレームから階層的な視覚的特徴量をエンドツーエンドで学習。
  • フェーズ分類とツール存在予測の両方を同時に最適化するマルチタスク損失関数の使用。
  • 13名の外科医が撮影した80本の胆嚢切除術動画を含むCholec80データセットで、ネットワークをファインチューニング。
  • 3次元畳み込み層を用いて空間的および時間的特徴量を抽出し、動画シーケンス内の空間時間的パターンを捉える。
  • 外部センサーやツール信号の手動アノテーションに依存せず、視覚入力のみに依存する。

実験結果

リサーチクエスチョン

  • RQ1深層CNNは、手作業で設計された特徴量よりも、腹腔鏡フェーズ認識により判別性の高い視覚的特徴量を学習できるか?
  • RQ2フェーズ認識とツール存在検出を同時に学習することで、単一タスク学習に比べて性能が向上するか?
  • RQ3CNNが学習する視覚的特徴量は、正例アノテーションから導出されたバイナリーツール信号を上回るか?
  • RQ4提案されたEndoNetアーキテクチャは、異なる腹腔鏡動画データセットに一般化可能か?
  • RQ51つの施設からのデータ変動がモデルの一般化に与える影響はどの程度か?また、その影響をどのように軽減できるか?

主な発見

  • EndoNetは、フェーズ認識およびツール存在検出の両タスクで最先端の性能を達成し、先行研究を上回っている。
  • 手作業で設計された特徴量やバイナリーツール信号に比べ、EndoNetが学習する視覚的特徴量は、フェーズ認識において顕著に優れている。特に、正例アノテーションに基づくバイナリーツール信号ですら、その性能を上回っている。
  • モデルは、より小さなEndoVisデータセットに対しても良好に一般化しており、学習された特徴量の頑健性と転送可能性を示している。
  • Cholec80データセットのより大きなサブセットでファインチューニングすることで性能が向上し、より多くのデータでスケーラビリティがあることが示された。
  • 腹腔鏡動画には、単なるツール存在の有無以上の豊かな視覚的特徴が含まれており、EndoNetがその特徴を効果的に捉えていることが示された。
  • モデルの一般化を向上させ、過学習を低減するためには、より大規模で多施設にまたがるデータセットの構築が不可欠であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。