Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal In-bed Pose and Shape Estimation under the Blankets

Yu Yin, J. Paul Robinson|arXiv (Cornell University)|2020. 12. 12.
Human Pose and Action Recognition인용 수 8
한 줄 요약

이 논문은 깊이, 적외선, 압력 맵, RGB 데이터를 순차적으로 융합하는 피라미드 융합 기반 기법과, 가림을 복구하기 위한 주의 기반 복원 모듈을 사용하여 극한의 담요 가림 상태에서도 3D 침대 내 인간 자세 및 형태 추정을 위한 새로운 다중모달 프레임워크를 제안한다. 이 방법은 순환적 개선을 통해 재구성 오차를 최대 2mm 감소시켜 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Humans spend vast hours in bed -- about one-third of the lifetime on average. Besides, a human at rest is vital in many healthcare applications. Typically, humans are covered by a blanket when resting, for which we propose a multimodal approach to uncover the subjects so their bodies at rest can be viewed without the occlusion of the blankets above. We propose a pyramid scheme to effectively fuse the different modalities in a way that best leverages the knowledge captured by the multimodal sensors. Specifically, the two most informative modalities (i.e., depth and infrared images) are first fused to generate good initial pose and shape estimation. Then pressure map and RGB images are further fused one by one to refine the result by providing occlusion-invariant information for the covered part, and accurate shape information for the uncovered part, respectively. However, even with multimodal data, the task of detecting human bodies at rest is still very challenging due to the extreme occlusion of bodies. To further reduce the negative effects of the occlusion from blankets, we employ an attention-based reconstruction module to generate uncovered modalities, which are further fused to update current estimation via a cyclic fashion. Extensive experiments validate the superiority of the proposed model over others.

연구 동기 및 목표

  • 의료 모니터링에서 흔하지만 아직 탐구되지 않은 상황인 담요에 완전히 가려진 상태에서 3D 인간 자세 및 형태 추정 문제를 해결하기 위해.
  • RGB의 가림 상태에서 열악한 성능, 압력 맵의 표면 외 부위에 대한 데이터 누락, 깊이 및 적외선의 가림 및 열 잔여물에 대한 민감성 등의 단일 모달리티 접근 방식의 한계를 극복하기 위해.
  • 가장 정보가 많은 모달리티부터 우선적으로 활용하는 계층적 융합 전략을 설계하여 깊이 및 적외선을 먼저 융합하고, 이후에 가림에 강인한 압력 맵과 고해상도 RGB 데이터로 점진적으로 추정치를 정밀화하기 위해.
  • 새로운 주의 기반 복원 모듈을 통해 담요 가림의 부정적 영향을 줄이고, 순환적 개선을 위한 가짜로 복원된 모달리티를 생성함으로써 자세 및 형태 추정치의 반복적 개선을 가능하게 하기 위해.

제안 방법

  • 정보량 순서에 따라 모달리티를 순차적으로 융합하는 피라미드 융합 기법을 설계함: 기초 수준에서 깊이 및 적외선을 먼저 융합하고, 그 다음 압력 맵을 융합하며, 마지막으로 상단 수준에서 RGB를 융합함.
  • 粗-세밀 추정 파이프라인을 사용함: 입력 모달리티로부터 먼저 3D 메시를 예측한 후, 주의 기반 복원 모듈을 통해 개선함.
  • 주의 기반 복원 모듈은 공간적 및 채널별 주의를 활용하여 관련 특징에 집중함으로써, 특히 깊이 및 RGB 모달리티의 가려진 영역에 대한 합성적이고 노출된 버전을 생성함.
  • 복원된 모달리티는 순환적으로 네트워크에 다시 융합되어 자세 및 형태 추정치를 반복적으로 향상시킴.
  • 부분적인 모달리티 가용성에도 강건하여, 깊이 및 적외선만 존재하는 경우에도 정확한 추론이 가능함.
  • 3D 메시 재구성 손실, 투영된 메시에서의 세그먼테이션 정확도 및 F1 스코어를 조합하여 모델을 훈련 및 평가함.

실험 결과

연구 질문

  • RQ1정보량이 많은 센서(깊이 및 적외선)를 우선적으로 활용하는 다중모달 융합 전략이 극한의 가림 상태에서도 3D 침대 내 자세 및 형태 추정 성능을 향상시킬 수 있는가?
  • RQ2깊이, 적외선, 압력 맵, RGB 모달리티를 순차적으로 융합하는 피라미드 융합 방식이 단순한 초기 융합 또는 후기 융합 대비 성능 및 강건성 면에서 어떻게 비교되는가?
  • RQ3주의 기반 복원 모듈이 깊이 및 RGB 모달리티에서 손실되거나 가려진 정보를 얼마나 효과적으로 복원하여 추정 정확도를 향상시킬 수 있는가?
  • RQ4복원된 모달리티를 다시 모델에 피드백하는 순환적 개선 과정이 단일 패assing 추론 대비 자세 및 형태 추정 성능을 크게 향상시키는가?
  • RQ5신체가 부분적 또는 완전히 커버된 상태일 때, 개별 모달리티(특히 압력 맵 및 RGB)가 성능에 기여하는 정도는 어느 정도인가?

주요 결과

  • 피라미드 융합 기법은 초기 융합 및 무융합 기반 모델보다 유의미하게 뛰어난 성능을 보이며, 비피라미드 융합 대비 평균 재구성 오차를 1.2mm 감소시킴.
  • 주의 기반 복원 모듈은 평균 재구성 오차를 2mm 향상시켜 성능을 향상시키며, 정성적 결과에서는 복원 후 깊이 구조가 더 명확하고 메시 피팅이 향상됨.
  • 깊이 및 적외선 모달리티가 가장 정보량이 많아 초도 자세 추정에 가장 기여하며, 압력 맵은 중요한 가림에 강인한 접촉 정보를 제공함.
  • RGB 데이터는 높은 해상도를 지니고 있지만, 담요에 의해 가려진 자세에서는 성능이 열악하지만, 신체가 노출된 경우 형태 정확도 향상에 기여함.
  • 완전한 모델(IR+깊이+압력 맵+RGB, 피라미드 융합 및 복원 포함)은 최저 재구성 오차(74.83mm)를 기록하여 전체 파이프라인의 효과성을 입증함.
  • 부분적인 모달리티 가용성 조건에서도 모델은 효과적으로 작동하며, 실제 운영 환경에서의 강건성과 일반화 능력을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.