Skip to main content
QUICK REVIEW

[논문 리뷰] A Robotic 3D Perception System for Operating Room Environment Awareness

Zhaoshuo Li, Amirreza Shaban|arXiv (Cornell University)|2020. 03. 20.
Surgical Simulation and Training참고 문헌 17인용 수 8
한 줄 요약

이 논문은 다빈치 Xi 수술 로봇의 환자 측 카트에 장착된 네 대의 시간 간격 기반 거리 측정(ToF) 카메라를 활용하여 실시간 수술실(OR) 환경 이해를 위한 동적 다중 시점 3D 인식 시스템을 제시한다. 새로운 학습 기반 다중 시점 투영 및 융합(MVPM) 알고리즘을 통해 2D 강도 이미지와 3D 포인트 클라우드 데이터를 융합함으로써 단일 시점 방법에 비해 더 나은 의미 분할 성능을 달성한다. 특히 저주파 수업에 대해 향상된 성능을 보이며, 안마차에 대한 평균 교차율(mIOU)은 0.711±0.031, 마요 스탠드에 대한 평균 교차율은 0.687±0.060을 기록한다.

ABSTRACT

Purpose: We describe a 3D multi-view perception system for the da Vinci surgical system to enable Operating room (OR) scene understanding and context awareness. Methods: Our proposed system is comprised of four Time-of-Flight (ToF) cameras rigidly attached to strategic locations on the daVinci Xi patient side cart (PSC). The cameras are registered to the robot's kinematic chain by performing a one-time calibration routine and therefore, information from all cameras can be fused and represented in one common coordinate frame. Based on this architecture, a multi-view 3D scene semantic segmentation algorithm is created to enable recognition of common and salient objects/equipment and surgical activities in a da Vinci OR. Our proposed 3D semantic segmentation method has been trained and validated on a novel densely annotated dataset that has been captured from clinical scenarios. Results: The results show that our proposed architecture has acceptable registration error ($3.3\%\pm1.4\%$ of object-camera distance) and can robustly improve scene segmentation performance (mean Intersection Over Union - mIOU) for less frequently appearing classes ($\ge 0.013$) compared to a single-view method. Conclusion: We present the first dynamic multi-view perception system with a novel segmentation architecture, which can be used as a building block technology for applications such as surgical workflow analysis, automation of surgical sub-tasks and advanced guidance systems.

연구 동기 및 목표

  • 다빈치 수술 로봇에서 실시간 수술실(OR) 환경 이해를 위한 동적이고 다중 시점 3D 인식 시스템을 개발한다.
  • 단일 시점에서의 시야 제한으로 인해 복잡하고 교차가 많은 수술실 환경에서의 강력한 의미 분할 도전 과제를 해결한다.
  • 다빈치 Xi 플랫폼에 적합한 일회성 校정 방법을 도입하여 확장 가능한 로봇 내장형 인식을 가능하게 한다.
  • 임상 수술실 환경에서 다중 시점 3D 의미 분할을 훈련하고 검증하기 위한 새로운 밀도 높은 애너테이션 데이터셋을 구축한다.
  • 다중 시점 융합을 통해 단일 시점의 한계를 극복하고, 저빈도 물체(예: 마요 스탠드, 안마차)의 분할 정확도를 향상시킨다.

제안 방법

  • 네 대의 시간 간격 기반 거리 측정(ToF) 카메라를 환자 측 카트(PSC)에 전략적 위치에 고정하여 시야 커버리지 최대화를 도모한다.
  • 맞춤형 프리셋 장치와 고정 장치를 사용한 일회성 校정 절차를 통해 모든 카메라를 로봇의 운동학 사슬에 정렬하여 통합 좌표 변환을 가능하게 한다.
  • 새로운 학습 기반 다중 시점 투영 및 융합(MVPM) 기법을 사용하여 모든 카메라의 2D 강도 이미지와 3D 포인트 클라우드 데이터를 공통의 로봇 기준 좌표 프레임으로 융합한다.
  • MVPM 알고리즘은 다중 시점 간의 픽셀 수준 분할 레이블과 신뢰도 점수를 학습하여 예측 일관성과 영역 스무딩을 향상시킨다.
  • 신규로 구축된 밀도 높은 애너테이션 다중 시점 데이터셋을 임상 다빈치 수술실 시나리오에서 수집하여 의미 분할 모델의 훈련 및 검증에 활용한다.
  • 프레임워크는 단일 시점 분할을 위한 백본 네트워크로 DeepLab V3+를 사용하며, MVPM을 예측 후 처리 단계에 적용하여 다중 시점 일관성을 활용해 출력을 개선한다.

실험 결과

연구 질문

  • RQ1다빈치 수술 로봇에 장착된 다중 시점 3D 인식 시스템이 실제 수술실 환경에서 단일 시점 방법에 비해 의미 분할 정확도를 향상시키는가?
  • RQ2제안된 MVPM 융합 기법은 안마차나 마요 스탠드와 같은 저빈도 또는 부분적으로 가림을 받는 물체의 분할 성능을 어떻게 향상시키는가?
  • RQ3일회성 校정 방법이 다양한 다빈치 Xi 시스템 간에 재보정 없이 즉시 사용 가능한 인식 시스템 배치를 얼마나 잘 지원하는가?
  • RQ42D 강도 이미지에 3D 포인트 클라우드 데이터를 통합하면 2D 전용 접근 방식보다 더 견고하고 정확한 환경 이해를 이룰 수 있는가?
  • RQ5가용한 카메라 시점 수가 전체 분할 성능에 어떤 영향을 미치며, 더 많은 시점 추가로 인한 성능 향상은 측정 가능한가?

주요 결과

  • 시스템은 객체-카메라 거리의 3.3% ± 1.4% 수준의 목표 등록 오차(TRE)를 달성하여 다중 카메라 校정의 신뢰성을 입증한다.
  • MVPM 방법은 저빈도 수업의 mIOU를 크게 향상시킨다: 인간에 대해 +0.013, 마요 스탠드에 대해 +0.020, 무 sterile 테이블에 대해 +0.015, 안마차에 대해 +0.037이며, 단일 시점 기준선 대비 향상된다.
  • MVPM 방법은 안마차에 대해 최종 mIOU 0.711 ± 0.031, 마요 스탠드에 대해 0.687 ± 0.060을 기록하여 DeepLab V3+ 및 Dense 3D CRF 기준선을 모두 초월한다.
  • 절단 분석 결과, 카메라 시점 수가 많을수록 분할 성능이 뚜렷하게 향상되며, 4대 대비 1대일 경우 p-value = 4.11E-9로 다중 시점 융합의 가치를 확인한다.
  • MVPM 방법은 픽셀 수준의 일관성과 영역 스무딩을 향상시켜 단일 시점에서 잘 분할되지 않는 부분적으로 가려진 물체(예: 안마차)를 성공적으로 복구한다.
  • 밀도 높은 3D CRF 기준선은 통계적으로 유의미한 향상 없이, 학습 기반의 신뢰도 인식 MVPM 융합 메커니즘의 우수성을 부각시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.