Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal In-bed Pose and Shape Estimation under the Blankets

Yu Yin, J. Paul Robinson|arXiv (Cornell University)|Dec 12, 2020
Human Pose and Action Recognition被引用数 8
ひとこと要約

本論文は、極端な毛布による遮蔽下におけるベッド内3次元人体ポーズおよび形状推定のための新規マルチモーダルフレームワークを提案する。ピラミッド統合方式を用いて、深度、赤外線、圧力マップ、RGBデータを情報量の順に段階的に統合し、遮蔽領域を回復するためのアテンションベースの再構成モジュールを組み合わせる。この手法は、サイクル的精錬を用いて最大2mmの再構成誤差低減を達成し、最先端の性能を発揮する。

ABSTRACT

Humans spend vast hours in bed -- about one-third of the lifetime on average. Besides, a human at rest is vital in many healthcare applications. Typically, humans are covered by a blanket when resting, for which we propose a multimodal approach to uncover the subjects so their bodies at rest can be viewed without the occlusion of the blankets above. We propose a pyramid scheme to effectively fuse the different modalities in a way that best leverages the knowledge captured by the multimodal sensors. Specifically, the two most informative modalities (i.e., depth and infrared images) are first fused to generate good initial pose and shape estimation. Then pressure map and RGB images are further fused one by one to refine the result by providing occlusion-invariant information for the covered part, and accurate shape information for the uncovered part, respectively. However, even with multimodal data, the task of detecting human bodies at rest is still very challenging due to the extreme occlusion of bodies. To further reduce the negative effects of the occlusion from blankets, we employ an attention-based reconstruction module to generate uncovered modalities, which are further fused to update current estimation via a cyclic fashion. Extensive experiments validate the superiority of the proposed model over others.

研究の動機と目的

  • 毛布による完全な遮蔽が生じる状況におけるベッド内3次元人体ポーズおよび形状推定の課題に取り組むこと。これは医療モニタリング分野において一般的ではあるが、十分に検討されていない状況である。
  • RGBの遮蔽下での性能劣化、PMの身体部の表面外領域でのデータ欠落、深度/赤外線の遮蔽および熱残留に起因する感度の低さといった単一モダリティ手法の限界を克服すること。
  • 情報量の高いモダリティを最初に統合する階層的統合戦略を設計すること。具体的には、深度と赤外線を最初に統合し、次に遮蔽に強い圧力マップ、最後に高解像度のRGBデータを段階的に統合する。
  • 毛布による遮蔽の悪影響を軽減するため、遮蔽されたモダリティの代替となる合成データを生成する新規アテンションベース再構成モジュールを導入し、ポーズおよび形状推定のサイクル的精錬を実現すること。

提案手法

  • 情報量の高い順にモダリティを統合するピラミッド統合方式を設計した。深度と赤外線をベースレベルで最初に統合し、次に圧力マップ、最後にRGBをトップレベルで統合する。
  • 粗いから細かい推定パイプラインを採用する。入力モダリティから最初に3次元メッシュを予測し、その後アテンションベース再構成モジュールを用いて精錬する。
  • アテンションベース再構成モジュールは、空間的およびチャネルワイドのアテンションを活用して関連特徴に焦点を当てることで、遮蔽されたモダリティ(特に深度とRGB)の合成された未遮蔽版を生成する。
  • 再構成されたモダリティは、サイクル的にネットワークに再統合され、ポーズおよび形状推定が繰り返し改善される。
  • 部分的なモダリティの欠落に対しても耐性を示し、深度と赤外線のみが利用可能な状況でも正確な推論が可能である。
  • 3次元メッシュ再構成損失、メッシュへの投影におけるセグメンテーション精度、F1スコアを組み合わせて、モデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1情報量の高いセンサ(深度と赤外線)を優先するマルチモーダル統合戦略が、極端な遮蔽下におけるベッド内3次元ポーズおよび形状推定を改善できるか?
  • RQ2深度、赤外線、圧力マップ、RGBの複数モダリティを段階的に統合するピラミッド統合方式は、単純な早期統合や後期統合と比較して、性能および耐性の面で優れているか?
  • RQ3アテンションベース再構成モジュールが、深度およびRGBモダリティにおける欠落または遮蔽された情報をどれほど回復でき、推定精度を向上させられるか?
  • RQ4再構成されたモダリティをモデルにフィードバックするサイクル的精錬プロセスは、単一パス推論と比較して、ポーズおよび形状推定の精度を顕著に向上させるか?
  • RQ5体が部分的または完全に覆われた状況において、個々のモダリティ(特にPMとRGB)が性能にどれほど寄与しているか?

主な発見

  • ピラミッド統合方式は、早期統合および非統合ベースラインを顕著に上回り、非ピラミッド統合と比較して平均再構成誤差を1.2mm低減した。
  • アテンションベース再構成モジュールは、平均して2mmの再構成誤差低減を達成した。定性的な結果では、再構成後の深度構造が明確になり、メッシュフィッティングが向上していることが確認された。
  • 深度と赤外線モダリティが最も情報量が多く、初期のポーズ推定に最も寄与している。一方、圧力マップは遮蔽に強い接触情報を提供する上で不可欠な役割を果たしている。
  • RGBデータは高解像度であるが、毛布による遮蔽の影響を受けて被覆されたポーズでは性能が著しく劣るが、体が露出している状況では形状精度に顕著に寄与している。
  • 完全なモデル(IR+Depth+PM+RGB、ピラミッド統合および再構成を含む)は、最小の再構成誤差(74.83mm)を達成し、包括的なパイプラインの有効性を示した。
  • 部分的なモダリティの可用性がある状況でもモデルは効果的であり、実世界の展開状況において優れた汎化性能と耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。