Skip to main content
QUICK REVIEW

[論文レビュー] SurgMAE: Masked Autoencoders for Long Surgical Video Analysis

Muhammad Abdullah Jamal, Omid Mohareri|arXiv (Cornell University)|May 19, 2023
Surgical Simulation and TrainingMedicine被引用数 3
ひとこと要約

SurgMAEは、ランダムなマスキングではなく、高次元時空間トークンをマスキング対象として選ぶことで、自己教師付き表現学習を向上させる、長時間の外科動画解析のための新しいマスク化自己オートエンコーダフレームワークを提案する。OR-ARおよびOR-ARv2データセットにおいて最先端の性能を達成し、特にデータが少ない状況下でも優れた一般化性能を示し、UCF-101においても既存手法を最大1.3% mAPおよび0.9%トップ1精度で上回る。

ABSTRACT

There has been a growing interest in using deep learning models for processing long surgical videos, in order to automatically detect clinical/operational activities and extract metrics that can enable workflow efficiency tools and applications. However, training such models require vast amounts of labeled data which is costly and not scalable. Recently, self-supervised learning has been explored in computer vision community to reduce the burden of the annotation cost. Masked autoencoders (MAE) got the attention in self-supervised paradigm for Vision Transformers (ViTs) by predicting the randomly masked regions given the visible patches of an image or a video clip, and have shown superior performance on benchmark datasets. However, the application of MAE in surgical data remains unexplored. In this paper, we first investigate whether MAE can learn transferrable representations in surgical video domain. We propose SurgMAE, which is a novel architecture with a masking strategy based on sampling high spatio-temporal tokens for MAE. We provide an empirical study of SurgMAE on two large scale long surgical video datasets, and find that our method outperforms several baselines in low data regime. We conduct extensive ablation studies to show the efficacy of our approach and also demonstrate it's superior performance on UCF-101 to prove it's generalizability in non-surgical datasets as well.

研究の動機と目的

  • マスク化自己オートエンコーダ(MAE)が、ラベルなしの長時間外科動画データから転移可能な表現を学習できるかどうかを調査すること。
  • MAEにおけるランダムマスキングの限界を克服するため、情報量の多い時空間的領域に重点を置いた新しいトークンサンプリング戦略を提案すること。
  • 大規模なラベルなし外科動画データを用いた自己教師付き事前学習を活用することで、外科行動認識におけるデータ効率性を向上させること。
  • 提案手法の一般化能力が外科的および非外科的動画ベンチマークの両方で有効であることを示すこと。

提案手法

  • 長時間の外科動画表現学習に適応したVision Transformerベースのマスク化自己オートエンコーダ、SurgMAEを提案する。
  • 埋め込み空間上の距離に基づいてマスキング対象のトークンを選択する、高次元時空間的トークンサンプリング戦略を導入し、情報量の多い領域を優先し、冗長または背景パッチを除外する。
  • 特徴の学習を促進するため、高いマスキング比(OR-ARでは90%、UCF-101では80%)を採用する。
  • 再構成のための可学習マスクトークンとデコーダヘッドを用い、可視トークンからマスキングされたパッチを再構成する。
  • 再構成品質の向上のため、パッチごとの正規化とL2(SE)損失を適用する。
  • 微調整を実行する下流分類タスクの前段階として、大規模なラベルなし外科動画データセット(OR-ARv2、Cataract-101)で事前学習を行う。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしの長時間外科動画から、マスク化自己オートエンコーダが転移可能な表現を効果的に学習できるか?
  • RQ2外科動画MAEにおいて、ランダムマスキングやフレーム/チューブマスキングと比較して、高次元時空間的トークンをマスキング対象に選ぶことで表現学習が向上するか?
  • RQ3SurgMAEは、完全にラベル付きデータを用いた場合と比較して、データが少ない状況下でどのように性能を発揮するか?
  • RQ4提案手法は、UCF-101のような非外科的動画データセットにも一般化可能か?
  • RQ5異なるマスキング戦略が、下流の外科行動認識性能に与える影響は何か?

主な発見

  • SurgMAEは、OR-ARで5%のラベル付きデータのみを用いても68.91% mAPを達成し、すべてのベースラインを上回った(ランダムマスキングを用いたMAEは64.66%、完全データで95.13%を達成したSwin-B+BiGRUをも上回った)。
  • OR-ARv2の完全データセットでは、SurgMAEが93.11% mAPを達成し、次の最高性能を示した手法(チューブマスキングを用いたVideoMAE、92.36%)を上回った。
  • UCF-101では、SurgMAEが92.1%のトップ1正解率を達成し、同じ高いマスキング比(80%)を用いたVideoMAE(91.2%)を上回った。
  • 提案された高次元時空間的サンプリング戦略は、すべてのデータセットで一貫して性能向上をもたらし、情報量の多いトークンを効果的に選択できることを確認した。
  • 完全データでの微調整ではランダムマスキングも良好な性能を示すが、SurgMAEの優位性は特にデータが少ない状況下で顕著であり、優れたデータ効率性を示している。
  • パッチごとの正規化とL2(SE)損失を用いたピクセル再構成は、原始的なピクセル再構成よりも優れた結果をもたらし、先行研究の結果とも整合した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。