[論文レビュー] LoViT: Long Video Transformer for Surgical Phase Recognition
LoViT は、段階的 L-Trans および ProbSparse 自注意力モジュールを用いて局所的およびグローバルな時間的特徴を統合する二段階型の Transformer ベース手法を提案し、段階遷移に配慮した監視とビデオクリップ単位の学習を活用することで、Cholec80 (+2.4 パーセンテージポイント) および AutoLaparo (+3.1 パーセンテージポイント) で最先端の性能を達成した。
Online surgical phase recognition plays a significant role towards building contextual tools that could quantify performance and oversee the execution of surgical workflows. Current approaches are limited since they train spatial feature extractors using frame-level supervision that could lead to incorrect predictions due to similar frames appearing at different phases, and poorly fuse local and global features due to computational constraints which can affect the analysis of long videos commonly encountered in surgical interventions. In this paper, we present a two-stage method, called Long Video Transformer (LoViT) for fusing short- and long-term temporal information that combines a temporally-rich spatial feature extractor and a multi-scale temporal aggregator consisting of two cascaded L-Trans modules based on self-attention, followed by a G-Informer module based on ProbSparse self-attention for processing global temporal information. The multi-scale temporal head then combines local and global features and classifies surgical phases using phase transition-aware supervision. Our approach outperforms state-of-the-art methods on the Cholec80 and AutoLaparo datasets consistently. Compared to Trans-SVNet, LoViT achieves a 2.4 pp (percentage point) improvement in video-level accuracy on Cholec80 and a 3.1 pp improvement on AutoLaparo. Moreover, it achieves a 5.3 pp improvement in phase-level Jaccard on AutoLaparo and a 1.55 pp improvement on Cholec80. Our results demonstrate the effectiveness of our approach in achieving state-of-the-art performance of surgical phase recognition on two datasets of different surgical procedures and temporal sequencing characteristics whilst introducing mechanisms that cope with long videos.
研究の動機と目的
- 標準モデルが細分化された時間的特徴を失う長時間(1〜2 時間)の手術動画における手術段階認識の課題に対処する。
- RNN や TCN が長距離依存関係を捉えきれず、手術動画シーケンスにおける細分化された特徴を保持できないという制限を克服する。
- マルチスケール時間アグリゲーターを用いて、局所的短時間特徴とグローバルな長時間特徴を統合することで、性能を向上させる。
- 段階遷移マップを用いた段階遷移に配慮した監視を導入し、段階遷移のモデリングを強化することで、認識精度を向上させる。
- ツールの存在や器具追跡などの追加アノテーションに依存せずに、長時間の動画においても高い精度と効率を維持する手法を開発する。
提案手法
- 類似した外観のフレームが複数の段階にわたって存在するため、フレーム単位の曖昧さを避けるために、ビデオクリップ単位の監視を用いて時間的に豊富な空間特徴抽出器を学習する。
- 短いビデオクリップからの局所的時間的特徴を蓄積するために、バニラ自己注意に基づく二つの段階的 L-Trans モジュールを採用する。
- 全手術動画にわたる長距離依存関係をモデル化するために、ProbSparse 自注意を用いた G-Informer モジュールを適用する。
- 局所的およびグローバルな特徴をマルチスケール時間ヘッドを介して統合し、段階分類を実行する。
- 段階遷移領域を強調するための段階遷移マップを監視信号として導入し、段階境界の認識を向上させる。
- 追加の計算コストやアノテーションのオーバーヘッドなしに、段階遷移に配慮した監視を用いたエンドツーエンド学習により、時間的推論能力を向上させる。

実験結果
リサーチクエスチョン
- RQ1Transformer ベースのアーキテクチャは、手術段階認識のため、長時間の手術動画において局所的およびグローバルな時間的依存関係を効果的に捉えることができるか?
- RQ2段階遷移に配慮した監視は、手術段階間の遷移を認識するモデルの能力をどのように向上させるか?
- RQ3マルチスケール時間アグリゲーターを用いた局所的およびグローバルな特徴の統合は、TCN や RNN に依存する既存手法を上回る性能を発揮するか?
- RQ4繰り返しのある段階や小規模なサンプル数を含むデータセット(例:AutoLaparo)において、モデルの性能はいかがなっているか?
- RQ5提案手法は、メモリや推論速度の劣化を伴わずに、長時間の動画においても高い精度と効率を維持できるか?
主な発見
- Cholec80 データセットにおいて、LoViT は Trans-SVNet よりもビデオレベルの正確性で 2.4 パーセンテージポイントの向上を達成した。
- より困難な AutoLaparo データセットにおいて、LoViT は Trans-SVNet よりも 3.1 パーセンテージポイントの向上を達成し、複雑な段階関係に対して強いロバストネスを示した。
- 両方のデータセットにおいて、TMRNet や TeCNO、Trans-SVNet よりも優れた性能を発揮し、優れた一般化能力と長時間シーケンスのモデリング能力を示した。
- 段階遷移に配慮した監視は、段階遷移の捕捉をモデルに効果的に可能にし、認識性能の向上に寄与した。
- 特に AutoLaparo のような繰り返しのある段階を含むデータセットでは、局所的時間的特徴がグローバルな関係よりも情報量が多く、重要であることがわかった。
- ProbSparse 自注意の使用により、細分化された特徴を保持しながら効率的なグローバルモデリングが可能となり、細分化された特徴を失う可能性のあるドレインドコンボリューションベースの TCN 手法を上回った。
![Figure 2: Example of similar frames (first and third) corresponding to different phases in Cholec80 dataset [ 14 ] .](https://ar5iv.labs.arxiv.org/html/2305.08989/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。