Skip to main content
QUICK REVIEW

[논문 리뷰] Relational Graph Learning on Visual and Kinematics Embeddings for Accurate Gesture Recognition in Robotic Surgery

Yonghao Long, Jie Ying Wu|arXiv (Cornell University)|2020. 11. 03.
Multimodal Machine Learning Applications참고 문헌 47인용 수 7
한 줄 요약

이 논문은 수술 자세 인식을 향상시키기 위해 시각적 및 운동학적 임bedding을 계층적 상관관계 그래프 학습을 통해 동적으로 융합하는 다중모달 관계 그래프 네트워크인 MRG-Net을 제안한다. 시간적 컨volution 네트워크와 LSTMs를 활용하여 특징을 추출하고, 유도 그래프를 통해 다중모달 관계를 모델링함으로써, JIGSAWS 수술 작업에서 최신 기준 성능(91.0%)과 에디트 스코어(98.7%)를 달성하였으며, 내부 dVRK 데이터셋에서도 뛰어난 성능을 보였다.

ABSTRACT

Automatic surgical gesture recognition is fundamentally important to enable intelligent cognitive assistance in robotic surgery. With recent advancement in robot-assisted minimally invasive surgery, rich information including surgical videos and robotic kinematics can be recorded, which provide complementary knowledge for understanding surgical gestures. However, existing methods either solely adopt uni-modal data or directly concatenate multi-modal representations, which can not sufficiently exploit the informative correlations inherent in visual and kinematics data to boost gesture recognition accuracies. In this regard, we propose a novel online approach of multi-modal relational graph network (i.e., MRG-Net) to dynamically integrate visual and kinematics information through interactive message propagation in the latent feature space. In specific, we first extract embeddings from video and kinematics sequences with temporal convolutional networks and LSTM units. Next, we identify multi-relations in these multi-modal embeddings and leverage them through a hierarchical relational graph learning module. The effectiveness of our method is demonstrated with state-of-the-art results on the public JIGSAWS dataset, outperforming current uni-modal and multi-modal methods on both suturing and knot typing tasks. Furthermore, we validated our method on in-house visual-kinematics datasets collected with da Vinci Research Kit (dVRK) platforms in two centers, with consistent promising performance achieved.

연구 동기 및 목표

  • 기존 방법들이 단일 모달 데이터를 사용하거나 단순한 다중모달 특징 연결을 사용함으로써 로봇 수술에서 시각적 및 운동학적 데이터 간의 깊은 상관관계를 활용하지 못하는 한계를 해결하기 위해.
  • 시각적 장면과 로봇 운동 시퀀스 간의 공동 지식과 관계적 의존성을 포착하는 동적이고 온라인 다중모달 융합 프레임워크를 개발하기 위해.
  • 계층적 관계 그래프 구조를 통해 잠재 특징 공간에서의 상호의존성을 모델링하여 수술 자세 인식의 정확성과 시간적 매끄러움을 향상시키기 위해.
  • 공개(JIGSAWS) 및 비공개(내부 dVRK) 데이터셋에서의 검증을 통해 다양한 수술 플랫폼과 데이터 수집 조건 간의 일반화 능력을 입증하기 위해.

제안 방법

  • 시각적 및 운동학적 시퀀스는 시공간적 특징을 캡처하기 위해 시간적 컨volution 네트워크(TCN)와 장기 단기 기억(LSTM) 네트워크를 사용하여 임베딩된다.
  • 시각적 및 운동학적 임베딩 간의 다중관계 표현이 식별되어 다양한 이중모달 관계를 모델링한다.
  • 계층적 관계 그래프 학습 모듈은 유도 그래프 내의 노드 간 메시지 전달을 수행하여 잠재 공간에서 다중모달 지식을 동적으로 집계한다.
  • 그래프 구조는 주목적 기반 집계를 통해 엔드 투 엔드 학습을 가능하게 하며, 자세 인식 과정에서 중요한 이중모달 상호작용에 집중할 수 있도록 한다.
  • 분류 정확도와 예측의 시간적 일관성을 최적화하기 위해 교차 엔트로피 손실과 에디트-거리 손실을 사용하여 엔드 투 엔드로 학습된다.

실험 결과

연구 질문

  • RQ1로봇 수술에서의 시각적 및 운동학적 데이터는 단순한 연결이나 조기 융합을 넘어서 어떻게 효과적으로 융합하여 자세 인식 성능을 향상시킬 수 있는가?
  • RQ2시각적 및 운동학적 임베딩 간의 다중관계 의존성을 모델링할 경우, 인식 정확도와 시간적 매끄러움에 어떤 영향을 미치는가?
  • RQ3관계 기반 그래프 네트워크 아키텍처는 다양한 수술 플랫폼과 데이터 수집 조건 간에서 다중모달 특징을 동적으로 통합하여 일반화할 수 있는가?
  • RQ4제안된 MRG-Net은 JIGSAWS 및 내부 dVRK 데이터셋과 같은 표준 벤치마크에서 최신 기준의 단일모달 및 다중모달 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • JIGSAWS 수술 작업에서 MRG-Net은 91.0%의 정확도와 98.7%의 에디트 스코어를 달성하였으며, 최고의 베이스라인(ResNet-18)보다 정확도에서 10.3%p, 에디트 스코어에서 63.6%p 향상되었다.
  • JIGSAWS 결속 작업에서 MRG-Net은 87.3%의 정확도와 96.4%의 에디트 스코어를 기록하여 단일모달 및 다중모달 베이스라인을 일관되게 뛰어넘는 성능을 보였다.
  • 내부 CUHK dVRK 데이터셋에서 91.0%의 정확도와 98.7%의 에디트 스코어를, JHU dVRK 데이터셋에서 87.3%의 정확도와 96.4%의 에디트 스코어를 기록하여 다양한 수술 센터 간의 강건성을 확인하였다.
  • 제거 실험 결과, 관계 그래프 모듈이 성능 향상에 크게 기여하여, 특징 연결을 넘어서 이중모달 의존성을 포착하는 데서의 역할을 확인하였다.
  • 에디트 스코어가 높아 시간적 매끄러움이 뛰어나, 안정적이고 일관된 자세 예측이 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.