[論文レビュー] A real-time spatiotemporal AI model analyzes skill in open surgical videos
本論文では、50か国・23の手術プロトコルをカバーするYouTubeから収集された、公開利用可能な最大規模のオープン外科動画データセットであるAVOSを用いて、リアルタイムで空間的・時間的要因を統合したマルチタスクAIモデルを提案する。このモデルは、同時に手、器具、行動、および手のキーポイントを検出するとともに、手の運動の力学的特徴(キネマティック記述子)としての手術スキルを特定し、多様な臨床環境に一般化できることを示し、手の動きの効率性を用いたスキルレベルの予測が可能であることを検証した。
Open procedures represent the dominant form of surgery worldwide. Artificial intelligence (AI) has the potential to optimize surgical practice and improve patient outcomes, but efforts have focused primarily on minimally invasive techniques. Our work overcomes existing data limitations for training AI models by curating, from YouTube, the largest dataset of open surgical videos to date: 1997 videos from 23 surgical procedures uploaded from 50 countries. Using this dataset, we developed a multi-task AI model capable of real-time understanding of surgical behaviors, hands, and tools - the building blocks of procedural flow and surgeon skill. We show that our model generalizes across diverse surgery types and environments. Illustrating this generalizability, we directly applied our YouTube-trained model to analyze open surgeries prospectively collected at an academic medical center and identified kinematic descriptors of surgical skill related to efficiency of hand motion. Our Annotated Videos of Open Surgery (AVOS) dataset and trained model will be made available for further development of surgical AI.
研究の動機と目的
- オープン手術動画分析におけるAI学習のための、大規模かつ多様なデータセットが不足している問題に対処すること。
- 多様な環境下で空間的・時間的手術行動を理解できる、リアルタイムで動作するマルチタスクAIモデルを開発すること。
- 臨床的アウトカムと相関する動画データから、客観的で力学的記述子としての手術スキルを同定すること。
- 公に利用可能な動画で学習したAIモデルが、学術的医療機関から得た前向きに収集された臨床データへ一般化できることを実証すること。
- AVOSデータセットとトレーニング済みモデルを公開し、手術AI分野の研究を加速させること。
提案手法
- 23の手術プロトコルと50か国から成る、1,997本のオープン手術動画をYouTubeから収集し、AVOSデータセットを構築した。
- 343本の動画を手動でアノテートし、手と器具のバウンディングボックス、21個の手のキーポイント、時間的行動ラベルを付与した。
- 共通のバックボーンを有するマルチタスク深層学習モデルを構築し、行動予測、手・器具検出、手のキーポイント推定を同時に実行した。
- 空間的・時間的モデリングを用いて、キーポイントベクトル間のL1距離を用い、フレーム間での手のポーズと運動の変化を追跡した。
- 線形判別分析を適用し、行動と器具使用の時間的推移や遷移確率を含む、30個の解釈可能な特徴を動画シーケンスから抽出した。
- ローバーレス・アウト・クロスバリデーションを用いてモデル性能を検証し、学術的医療機関から前向きに収集したデータを用いて一般化性能をテストした。
実験結果
リサーチクエスチョン
- RQ1多様で公開利用可能なYouTube動画で学習したマルチタスクAIモデルは、臨床現場におけるオープン手術プロシージャのリアルタイム分析に一般化可能か?
- RQ2オープン手術における外科医のスキルレベルと相関する手の運動の力学的特徴は何か?
- RQ3モデルの性能は、異なる動画品質、ズームレベル、手術種別においてどのように変化するか?
- RQ4複雑な現実世界の手術シーンにおいて、モデルは手・器具・行動を高い正確性と再現率で検出・局在化できるか?
- RQ5モデルが学習した特徴は、臨床的に意味のある手術スキルの記述子をどの程度反映しているか?
主な発見
- AVOSデータセットは、50か国から収集された1,997本のオープン手術動画で構成され、そのうち343本が手・器具・行動・21個の手のキーポイントについて完全にアノテートされている。
- マルチタスクモデルは、多様な動画品質とズームレベルにおいて高い正確性と再現率を達成し、IOU 0.5における器具検出のmAPは0.82、手検出のmAPは0.85を記録した。
- 学術的医療機関から前向きに収集したプロスペクティブデータセットにおいても、モデルは安定した性能を示し、手術スキルの力学的記述子を的確に同定した。
- 手の動きの効率性(時間経過に伴う総合的な手のポーズ変化量)は、外科医のスキルレベルと有意に相関しており、熟練度の高い外科医は運動ばらつきが小さいことが明らかになった。
- ローバーレス・アウト・クロスバリデーションの結果、個々の外科医を除外してもスキル重心の分布に顕著なシフトが認められず、モデルの個人差バイアスに対する耐性が示された。
- クラスアクティベーションマップによる解釈性の検証では、検出信頼度に最も寄与しているのは手や器具の近位部であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。