Skip to main content
QUICK REVIEW

[논문 리뷰] Detailed 2D-3D Joint Representation for Human-Object Interaction

Yong–Lu Li, Xinpeng Liu|arXiv (Cornell University)|2020. 04. 17.
Human Pose and Action Recognition참고 문헌 61인용 수 17
한 줄 요약

이 논문은 단일 뷰 재구성과 투영을 통해 정밀한 3D 신체 형태(얼굴 및 손)와 추정된 3D 물체 위치를 활용하는 새로운 2D-3D 공동 표현 학습 프레임워크인 DJ-RN을 제안한다. 2D 및 3D 특징을 교차 모odal 일致성 작업을 통해 융합함으로써, HICO-DET 및 새로운 모호한 벤치마크인 Ambiguous-HOI에서 각각 21.34 mAP 및 10.37 mAP의 최신 기준 성능(SoTA)을 달성한다.

ABSTRACT

Human-Object Interaction (HOI) detection lies at the core of action understanding. Besides 2D information such as human/object appearance and locations, 3D pose is also usually utilized in HOI learning since its view-independence. However, rough 3D body joints just carry sparse body information and are not sufficient to understand complex interactions. Thus, we need detailed 3D body shape to go further. Meanwhile, the interacted object in 3D is also not fully studied in HOI learning. In light of these, we propose a detailed 2D-3D joint representation learning method. First, we utilize the single-view human body capture method to obtain detailed 3D body, face and hand shapes. Next, we estimate the 3D object location and size with reference to the 2D human-object spatial configuration and object category priors. Finally, a joint learning framework and cross-modal consistency tasks are proposed to learn the joint HOI representation. To better evaluate the 2D ambiguity processing capacity of models, we propose a new benchmark named Ambiguous-HOI consisting of hard ambiguous images. Extensive experiments in large-scale HOI benchmark and Ambiguous-HOI show impressive effectiveness of our method. Code and data are available at https://github.com/DirtyHarryLYL/DJ-RN.

연구 동기 및 목표

  • 희소한 2D 자세 및 외관 정보로 인해 시점 모호성이 발생하는 2D 기반 HOI 검출의 한계를 해결한다.
  • 세부적인 3D 인간 신체 형태(얼굴 및 손)를 통합함으로써 굵은 3D 관절 표현의 부족을 보완하여 더 풍부한 기하학적 및 의미적 이해를 가능하게 한다.
  • 2D 공간적 구성과 카테고리 사전 지식을 사용하여 물체의 위치와 크기를 추정함으로써 상호작용하는 물체의 3D 표현을 도입한다.
  • 교차 모달 일치를 강제하는 공동 2D-3D 학습 프레임워크를 개발하여 시점 모호성 해소 및 내성 강도 향상을 도모한다.
  • HOI 검출에서 2D 시점 모호성을 해결할 수 있는 능력을 철저히 평가하기 위해 새로운 벤치마크인 Ambiguous-HOI를 제안한다.

제안 방법

  • SMPLify-X와 같은 단일 뷰 인간 신체 캡처를 활용하여 얼굴 및 손 기하학까지 포함한 정밀한 3D 인간 형태를 재구성한다.
  • 2D 인간-물체 공간 관계와 물체 카테고리 사전 지식을 사용하여 3D 물체의 위치와 크기를 추정하며, 정규화된 3D 부피 내에서 빈 볼로 표현한다.
  • 공유된 3D 공간에 3D 인간 및 물체 표현을 배치하여 3D HOI 공간 구성 부피를 구성한다.
  • RGB 이미지와 3D 부피에서 모odal별 특징을 추출하기 위해 2D-RN과 3D-RN을 포함한 이중 스트림 네트워크(DJ-RN)를 설계한다.
  • 세 가지 작업을 통해 교차 모달 일치를 강제한다: 3D 공간 특징에 의해 안내되는 2D 특징 정렬, 2D 및 3D 특징 간 의미 일치, 신체 부위에 대한 공동 주의 힘 학습.
  • 다중 작업 학습을 적용하며, 손실 함수로 $γ_{att}$를 주의 일치에, $γ_{tri}$를 트리플릿 대비 학습에, $γ_{sem}$을 의미 일치에 사용한다.

실험 결과

연구 질문

  • RQ1손과 얼굴의 세부적인 3D 인간 신체 표현은 굵은 3D 관절 표현에 비해 HOI 검출 성능을 크게 향상시키는가?
  • RQ2단일 뷰 2D 신호와 카테고리 사전 지식을 이용한 3D 물체 추정은 HOI 이해를 얼마나 효과적으로 향상시키는가?
  • RQ3교차 모달 일치를 통한 공동 2D-3D 표현 학습은 어떤 정도까지 시점 모호성이 있는 이미지에서의 해소를 향상시키는가?
  • RQ4Ambiguous-HOI와 같은 새로운 벤치마크는 2D 모호성에 대한 모델의 내성 강도를 효과적으로 평가하고 구분할 수 있는가?
  • RQ5제안된 공동 학습 프레임워크는 독립적인 2D 또는 3D 모델보다 희귀 및 긴 尾 HOI 카테고리에 더 잘 일반화되는가?

주요 결과

  • DJ-RN은 HICO-DET Default Full 세트에서 21.34 mAP를 달성하여 이전 SoTA 방법보다 1.94 mAP 높은 성능을 보였다.
  • 제안된 Ambiguous-HOI 벤치마크에서 DJ-RN은 10.37 mAP를 기록하여 다음으로 우수한 방법(Julia 등)보다 0.65 mAP 높은 성능을 보였다.
  • 3D-RN 구성 요소만으로도 HICO-DET에서 12.41 mAP를 달성했으며, 희귀 카테고리(18.53 mAP)에서는 비희귀 카테고리(22.18 mAP)보다 더 높은 일반화 성능를 보였는데, 이는 데이터 의존도가 낮음을 시사한다.
  • 제거 실험 결과 손 및 얼굴 세부 정보를 제거할 경우 성능이 각각 0.51 및 0.32 mAP 감소하여 수작업 동작에 있어 이들의 중요성을 확인한다.
  • 모든 일치 손실($\mathcal{L}_{att}$, $\mathcal{L}_{tri}$, $\mathcal{L}_{sem}$)을 포함한 공동 학습 프레임워크는 21.34 mAP를 달성했으며, 어느 하나의 손실만 제거해도 성능이 0.5–0.6 mAP 감소했다.
  • 시각화 결과 2D 및 3D 주의 맵이 잘 정렬되어 있으며, 의미적으로 관련 있는 신체 부위(예: '자르기'에 대해 손, '말하기'에 대해 얼굴)에 집중하고 있음을 확인하여 일치 학습의 타당성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.