Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-view RGB-D Approach for Human Pose Estimation in Operating Rooms

Abdolrahim Kadkhodamohammadi, Afshin Gangi|arXiv (Cornell University)|2017. 01. 25.
Human Pose and Action Recognition참고 문헌 37인용 수 4
한 줄 요약

이 논문은 수술실에서 3D 인간 자세 추정을 위한 다중 시점 RGB-D 접근법을 제안한다. 컨볼루션 네트워크(ConvNets)를 활용해 부위 검출을 수행하고, 3D 쌍별 제약 조건을 도입해 운동학적 일致성을 강제한다. 세 대의 동기화된 카메라에서 깊이 데이터를 융합하고, 임의의 숲(random forests)을 사용해 부정확한 검출을 걸러내어, 기존 최고 수준의 방법들에 비해 특히 다중 인원, 가림, 시각적으로 혼잡한 수술실 환경에서 뚜렷한 정확도 향상을 달성한다.

ABSTRACT

Many approaches have been proposed for human pose estimation in single and multi-view RGB images. However, some environments, such as the operating room, are still very challenging for state-of-the-art RGB methods. In this paper, we propose an approach for multi-view 3D human pose estimation from RGB-D images and demonstrate the benefits of using the additional depth channel for pose refinement beyond its use for the generation of improved features. The proposed method permits the joint detection and estimation of the poses without knowing a priori the number of persons present in the scene. We evaluate this approach on a novel multi-view RGB-D dataset acquired during live surgeries and annotated with ground truth 3D poses.

연구 동기 및 목표

  • 표면의 시각적 유사성과 무문성 있는 수술복으로 인해 표준 RGB 방법이 실패하는 수술실에서 3D 인간 자세 추정의 과제를 해결하기 위해.
  • 사전에 존재하는 사람 수를 알지 못한 채, 다수의 임상의사의 자세를 검출하고 3D 자세를 추정할 수 있는 시스템을 개발하기 위해.
  • 깊이 데이터를 특징 향상 외에도 정확한 3D 점 역투영과 다중 시점 대응을 위해 활용하여, 외관 기반 매칭 실패를 보완하기 위해.
  • 신뢰도 맵, 깊이 재투영 비용, 다중 시점 일致성을 통합하여 3D 부위 위치를 공동 최적화함으로써 국소화 정확도를 향상시키기 위해.

제안 방법

  • 큰 수신장( receptive fields)을 통해 맥락 정보를 통합하여, 각 시점에서 신체 부위를 검출하기 위해 RGB-D 데이터 기반의 ConvNet 기반 부위 검출기를 훈련한다.
  • 3D 쌍별 변형 모델이 3D 공간에서 직접적으로 신체 부위 간 운동학적 제약 조건을 강제하여, 혼잡한 장면에서 관절의 일致성을 향상시킨다.
  • 수술실에 특화된 특징을 기반으로 임의의 숲을 훈련하여 수술실에 대한 사전 지식을 학습하고, 각 시점의 부정확한 스켈레톤 후보를 걸러낸다.
  • 검출 결과를 깊이 맵을 사용해 3D로 역투영함으로써, 한 시점에서만 점이 보일 경우에도 3D 대응을 가능하게 한다.
  • 검출 신뢰도, 깊이 재투영 비용, 다중 시점 증거를 통합하여 3D 부위 위치를 최적화하는 새로운 에너지 함수를 제안하며, 네 단계의 반복적 최적화를 수행한다.
  • 3D 공간을 효율적으로 탐색하기 위해 50 cm, 10 cm, 2 cm, 1 cm의 단계 크기를 갖는 굵은 단계에서 세밀한 단계로의 검색 전략을 사용한다.

실험 결과

연구 질문

  • RQ1깊이 데이터는 외관 특징 향상 외에도 수술실에서 3D 인간 자세 추정에 기여할 수 있는가?
  • RQ2사전에 사람 수를 알지 못한 채, 다중 시점 RGB-D 데이터를 어떻게 활용하여 다수의 사람 자세를 신뢰성 있게 검출하고 추정할 수 있는가?
  • RQ33D 운동학적 제약 조건을 강제할 경우, 가림 및 혼잡한 수술실 환경에서 자세 추정 성능은 얼마나 향상되는가?
  • RQ4깊이 기반 재투영 비용은 다중 시점 간 3D 자세 최적화를 얼마나 효과적으로 이끄는가?

주요 결과

  • 라벨 투표를 사용할 경우, 하나 또는 두 개의 시점에서 검출된 스켈레톤의 3D 신체 부위 국소화 오차를 최대 10cm 감소시키고, 세 개의 시점에서 검출된 경우 약 3cm 감소시켜 검출 신뢰도 향상을 입증한다.
  • 다중 시점 최적화 덕분에 단 한 시점에서만 검출된 스켈레톤의 국소화 오차도 감소함을 보여주며, 깊이 기반 재투영 비용과 신뢰도 융합의 효과를 입증한다.
  • 깊이 기반 재투영 비용 항목을 제외할 경우 성능 저하가 심각하게 발생함을 확인하여, 정확한 3D 자세 보정에서 이 항목의 핵심적 역할을 입증한다.
  • 다중 시점 융합 이후 높은 정밀도의 3D 스켈레톤 검출을 달성하였으며, 임의의 숲 사전 지식이 부정확한 후보를 걸러내어 검출 품질을 크게 향상시켰다.
  • 최적화 함수에 3D 쌍별 제약 조건을 도입함으로써, 특히 다중 인원 및 가림 상황에서 더 일관되고 정확한 신체 구성이 가능해졌음을 확인하였다.
  • 제안된 방법은 장면 내 사람 수에 대한 사전 지식 없이도 동시에 검출 및 자세 추정을 수행할 수 있는 최초의 다중 시점 RGB-D 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.