Skip to main content
QUICK REVIEW

[논문 리뷰] 4D-OR: Semantic Scene Graphs for OR Domain Modeling

Ege Özsoy, Evin Pınar Örnek|arXiv (Cornell University)|2022. 03. 22.
Surgical Simulation and Training인용 수 6
한 줄 요약

이 논문은 복잡한 수술실 상호작용을 모델링하기 위해 풍부하게 애너테이션된 의미적 시나리오 그래프(semantic scene graphs, SSG)를 갖춘 공개된 첫 번째 4D(3D+시간) 수술 데이터셋인 4D-OR을 소개한다. 이는 종합적인 수술실 환경 이해를 위한 엔드 투 엔드 신경망 기반 SSG 생성을 가능하게 한다. 방법은 관계 예측에서 0.75 매크로 F1, 임상 역할 예측에서 0.85 매크로 F1을 달성하여 SSG가 복잡한 수술실 상호작용을 모델링하는 데 효과적임을 입증한다.

ABSTRACT

Surgical procedures are conducted in highly complex operating rooms (OR), comprising different actors, devices, and interactions. To date, only medically trained human experts are capable of understanding all the links and interactions in such a demanding environment. This paper aims to bring the community one step closer to automated, holistic and semantic understanding and modeling of OR domain. Towards this goal, for the first time, we propose using semantic scene graphs (SSG) to describe and summarize the surgical scene. The nodes of the scene graphs represent different actors and objects in the room, such as medical staff, patients, and medical equipment, whereas edges are the relationships between them. To validate the possibilities of the proposed representation, we create the first publicly available 4D surgical SSG dataset, 4D-OR, containing ten simulated total knee replacement surgeries recorded with six RGB-D sensors in a realistic OR simulation center. 4D-OR includes 6734 frames and is richly annotated with SSGs, human and object poses, and clinical roles. We propose an end-to-end neural network-based SSG generation pipeline, with a rate of success of 0.75 macro F1, indeed being able to infer semantic reasoning in the OR. We further demonstrate the representation power of our scene graphs by using it for the problem of clinical role prediction, where we achieve 0.85 macro F1. The code and dataset will be made available upon acceptance.

연구 동기 및 목표

  • 의료 종사자, 환자, 장비 간의 상호작용을 모델링하여 복잡한 수술실 환경에 대한 자동화되고 종합적이며 의미적인 이해를 가능하게 하기 위해.
  • SSG 모델을 훈련하기 위한 공개 가능하고 다중 작업 애너테이션된 데이터셋의 부족을 해결하기 위해.
  • 3D 공간적 관계와 실시간 수술실 상황의 동적 상호작용을 포착하는 종합적인 SSG 생성을 위한 엔드 투 엔드 신경망 파이프라인 개발을 위해.
  • 임상 역할 예측과 같은 후행 임상 작업에 SSG의 유용성을 검증하기 위해.
  • 디지털 시스템이 구조적이고 의미적인 표현을 통해 수술실 역학을 추론할 수 있도록 향후 컴퓨터 지원 수술을 위한 기반을 마련하기 위해.

제안 방법

  • RGB-D 이미지, 3D 포인트 클라우드, 인스턴스 수준 레이블을 융합하여 수술실 상황의 의미적 시나리오 그래프(semantic scene graphs, SSG)를 생성하는 새로운 엔드 투 엔드 신경망 파이프라인을 제안한다.
  • 이미지에서의 3D 인간 자세 추정과 포인트 클라우드에서의 객체 검출을 통해 장면 내 모든 엔티티에 인스턴스 수준 레이블을 할당한다.
  • 융합된 시각적 및 기하적 특징을 기반으로 노드 간 관계(예: '외과의사가 환자에게 수술을 수행 중')를 예측하기 위해 그래프 신경망(Graphormer)을 사용한다.
  • 일반화 성능 향상과 SSG 생성 시 드문 관계 클래스의 균형을 맞추기 위해 데이터 증강 전략과 선형 손실 가중치를 적용한다.
  • 진정된 자세 또는 예측된 자세를 입력으로 통합하여, 자세 예측 오차에 대해 강건함을 입증한다.
  • 6대의 RGB-D 카메라로 구성된 다중 센서 설정을 활용하여 시뮬레이션된 전기관절 치환 수술 동안 동기화된 4D 데이터(3D+시간)를 캡처한다.

실험 결과

연구 질문

  • RQ1의미적 시나리오 그래프(SSG)는 실제 수술실에서의 복잡하고 동적인 다수의 주체 간 상호작용을 효과적으로 모델링할 수 있는가?
  • RQ2엔드 투 엔드 신경망이 다중 모odal 입력(이미지, 포인트 클라우드, 자세)으로부터 수술 환경에서 정확한 SSG를 생성할 수 있는가?
  • RQ3SSG는 수술 환경에서 임상 역할 예측과 같은 후행 임상 작업을 어느 정도 지원할 수 있는가?
  • RQ4이미지 모odal과 데이터 증강 전략의 사용이 SSG 생성 성능에 어떤 영향을 미치는가?
  • RQ5예측된 자세와 진정된 자세를 사용할 경우 SSG 생성 파이프라인이 얼마나 강건한가?

주요 결과

  • 제안된 SSG 생성 파이프라인이 관계 예측에서 매크로 F1 점수 0.75를 달성하여 복잡한 수술실 상황에서 효과적인 의미적 추론을 가능하게 한다.
  • 이미지와 데이터 증강의 통합이 SSG 생성 성능 향상에 크게 기여하며, 둘 다 사용할 경우 F1 점수가 0.65에서 0.78로 상승한다.
  • 진정된 자세를 사용할 경우 예측된 자세를 사용할 경우에 비해 성능 향상이 미미하며(0.78 대비 0.76), 자세 예측 오차에 대해 강건함을 입증한다.
  • Graphormer 기반 모델은 임상 역할 예측에서 매크로 F1 점수 0.85를 달성하여 히وري스틱 기반 베이스라인(매크로 F1 0.74)을 능가하며, 특히 보조 외과의사와 순환 간호사와 같은 역할에서 뛰어난 성능을 보인다.
  • 모델은 특히 가림을 입은 역할—특히 Anesthetist—에서 가장 어려움을 겪으며, F1 점수는 0.41에 불과하여 저조도 상황에서의 과제를 드러낸다.
  • 10회의 시뮬레이션된 전기관절 치환 수술, 총 6,734 프레임을 포함하는 4D-OR 데이터셋은 공개된 바 없는 첫 번째 4D 수술 SSG 데이터셋으로, 향후 수술 환경 이해 분야의 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.