Skip to main content
QUICK REVIEW

[論文レビュー] 4D-OR: Semantic Scene Graphs for OR Domain Modeling

Ege Özsoy, Evin Pınar Örnek|arXiv (Cornell University)|Mar 22, 2022
Surgical Simulation and Training被引用数 6
ひとこと要約

本論文は、包括的な意味的シーングラフ(SSG)を豊富にアノテートした、公開可能な最初の4D(3次元+時間)外科手術データセット4D-ORを紹介する。これにより、包括的な手術室(OR)シーン理解のためのエンドツーエンドニューラルネットワークベースのSSG生成が可能になる。本手法は関係予測で0.75のマクロF1を達成し、臨床的役割予測で0.85のマクロF1を達成し、複雑なOR内相互作用をモデル化するSSGの有効性を示している。

ABSTRACT

Surgical procedures are conducted in highly complex operating rooms (OR), comprising different actors, devices, and interactions. To date, only medically trained human experts are capable of understanding all the links and interactions in such a demanding environment. This paper aims to bring the community one step closer to automated, holistic and semantic understanding and modeling of OR domain. Towards this goal, for the first time, we propose using semantic scene graphs (SSG) to describe and summarize the surgical scene. The nodes of the scene graphs represent different actors and objects in the room, such as medical staff, patients, and medical equipment, whereas edges are the relationships between them. To validate the possibilities of the proposed representation, we create the first publicly available 4D surgical SSG dataset, 4D-OR, containing ten simulated total knee replacement surgeries recorded with six RGB-D sensors in a realistic OR simulation center. 4D-OR includes 6734 frames and is richly annotated with SSGs, human and object poses, and clinical roles. We propose an end-to-end neural network-based SSG generation pipeline, with a rate of success of 0.75 macro F1, indeed being able to infer semantic reasoning in the OR. We further demonstrate the representation power of our scene graphs by using it for the problem of clinical role prediction, where we achieve 0.85 macro F1. The code and dataset will be made available upon acceptance.

研究の動機と目的

  • 医療スタッフ、患者、機器間の相互作用をモデル化することで、複雑な手術室(OR)環境の自動的かつ包括的かつ意味的な理解を可能にすること。
  • SSGモデルの学習に適した、公開可能でマルチタスクにアノテートされたデータセットの不足に応えること。
  • 3次元空間的関係とリアルタイムのORシーン内での動的相互作用を捉える、エンドツーエンドのニューラルネットワークパイプラインによるSSG生成を実現すること。
  • SSGが手術環境における臨床的役割予測などの下流タスクを支援する有効性を検証すること。
  • 将来のコンピュータ支援手術の基盤を築くために、構造的かつ意味的な表現を通じてORのダイナミクスを理解できるデジタルシステムの実現を図ること。

提案手法

  • RGB-D画像、3次元点群、インスタンスレベルのラベルを統合する新しいエンドツーエンドニューラルネットワークパイプラインを提案し、ORシーンの意味的シーングラフ(SSG)を生成する。
  • 画像からの3次元人体ポーズ推定と点群からの物体検出を用いて、シーン内すべてのエンティティにインスタンスレベルのラベルを付与する。
  • 統合された視覚的および幾何的特徴に基づき、ノード間(例:「外科医が患者に対して手術を実施中」)の関係を予測するため、グラフニューラルネットワーク(Graphormer)を採用する。
  • 一般化性能の向上とSSG生成におけるレアな関係クラスのバランスを改善するため、データ拡張戦略と線形損失重み付けを適用する。
  • SSG生成モデルへの真値または予測された人体および物体ポーズの統合により、ポーズ予測誤差に対して高い耐性を示すことを実証する。
  • 6台のRGB-Dカメラを用いたマルチセンサーシステムにより、模擬的全股関節置換術の4Dデータ(3次元+時間)を同期的に取得する。

実験結果

リサーチクエスチョン

  • RQ1意味的シーングラフ(SSG)は、現実の手術室における複雑で動的かつマルチエージェントの相互作用を効果的にモデル化できるか?
  • RQ2エンドツーエンドのニューラルネットワークは、画像、点群、ポーズなどのマルチモodal入力から、外科学的文脈で正確なSSGを生成できるか?
  • RQ3SSGは、手術環境における臨床的役割予測などの下流タスクをどの程度支援できるか?
  • RQ4画像モダリティとデータ拡張の使用が、SSG生成性能に与える影響は何か?
  • RQ5予測されたポーズと真値ポーズの両方を用いる場合、SSG生成パイプラインの耐性はどの程度か?

主な発見

  • 提案されたSSG生成パイプラインは、関係予測でマクロF1スコア0.75を達成し、複雑なORシーンにおける効果的な意味的推論を示している。
  • 画像の統合とデータ拡張の両方を適用することで、SSG生成性能が著しく向上し、F1スコアは0.65から0.78に上昇した。
  • 真値ポーズを予測ポーズに置き換えても、性能向上はわずか(0.78 vs. 0.76)にとどまり、ポーズ予測誤差に対して高い耐性があることが示された。
  • Graphormerベースのモデルは、臨床的役割予測で0.85のマクロF1を達成し、ヒューリスティックベースのベースライン(0.74のマクロF1)を上回った。特にアシスタント・サージアンや巡回ナースの役割において顕著な優位性を示した。
  • 遮蔽された役割、特に麻酔科医の役割では最も困難であり、F1スコアはわずか0.41にとどまり、低視認状況における課題を浮き彫りにした。
  • 10件の模擬的全股関節置換術、6,734フレームを含む4D-ORデータセットは、公開可能な最初の4D外科SSGデータセットであり、将来的な外科学的シーン理解研究を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。