Skip to main content
QUICK REVIEW

[논문 리뷰] Pose-based Modular Network for Human-Object Interaction Detection

Zhijun Liang, Junfa Liu|arXiv (Cornell University)|2020. 08. 05.
Multimodal Machine Learning Applications참고 문헌 37인용 수 9
한 줄 요약

이 논문은 상대적 공간 자세 특징(관절-객체 오프셋)과 절대 자세 특징(정규화된 관절 좌표)을 모두 활용하여 인간-물체 상호작용(HOI) 검출을 향상시키는 자세 기반 모odu lar 네트워크(PMN)를 제안한다. 이 모듈은 공간적 및 내재적 자세 모델링을 위한 별도의 브랜치를 사용하며, 특징 정제를 위해 그래프 컨볼루션을 적용한다. VS-GATs와 조합했을 때 상태의 기준(SOTA) 성능을 달성하여 V-COCO에서 mAP를 2.0 향상시키고, HICO-DET 카테고리에서는 0.98–1.57 향상시킨다.

ABSTRACT

Human-object interaction(HOI) detection is a critical task in scene understanding. The goal is to infer the triplet in a scene. In this work, we note that the human pose itself as well as the relative spatial information of the human pose with respect to the target object can provide informative cues for HOI detection. We contribute a Pose-based Modular Network (PMN) which explores the absolute pose features and relative spatial pose features to improve HOI detection and is fully compatible with existing networks. Our module consists of a branch that first processes the relative spatial pose features of each joint independently. Another branch updates the absolute pose features via fully connected graph structures. The processed pose features are then fed into an action classifier. To evaluate our proposed method, we combine the module with the state-of-the-art model named VS-GATs and obtain significant improvement on two public benchmarks: V-COCO and HICO-DET, which shows its efficacy and flexibility. Code is available at \url{https://github.com/birlrobotics/PMN}.

연구 동기 및 목표

  • 기본 시각적 및 공간적 특징을 초월하여 세밀한 인간 자세 신호를 통합하여 인간-물체 상호작용(HOI) 검출을 향상시키는 것.
  • 여러 명의 인간과 물체가 가까이 위치한 혼잡한 장면에서 발생하는 가짜 양성(false positives) 문제를 해결하는 것.
  • 기존 HOI 검출 모델의 아키텍처를 대대적으로 수정하지 않고도 통합 가능한 모듈러이고 호환성이 뛰어난 구성 요소를 설계하는 것.
  • HOI 추론에서 인간 관절과 물체 간의 상대적 관계와 내재적 자세 구성 요소 간의 기여도를 비교 분석하는 것.

제안 방법

  • 상대적 공간 자세 특징은 각 인간 관절과 대상 물체의 바운딩 박스 중심 간의 오프셋으로 정의된다.
  • 절대 자세 특징은 인간 자신의 바운딩 박스 기준으로 정규화된 관절 좌표로, 내재적 자세 구성 요소를 캡처한다.
  • 전용 브랜치는 각 관절별로 독립적으로 완전 연결층을 사용하여 상대적 공간 자세 특징을 처리한다.
  • 다른 브랜치는 관절 간 관계를 모델링하는 완전 연결 그래프 구조를 사용하여 그래프 컨volutional 네트워크(GCNs)를 적용해 절대 자세 특징을 업데이트한다.
  • 양 브랜치에서 처리된 특징은 융합되어 액션 분류기로 전달되어 삼중체 예측을 수행한다.
  • PMN 모듈은 플러그 앤 플레이 방식이며, VS-GATs와 같은 기존 HOI 모델과 호환되어 엔드 투 엔드 학습이 가능하다.

실험 결과

연구 질문

  • RQ1인간 관절과 물체 간의 상대적 공간 자세 특징이 복잡한 장면에서 HOI 검출 정확도를 향상시키는가?
  • RQ2내재적 인간 자세를 나타내는 절대 자세 특징이 상호작용 액션을 구분하는 데 얼마나 기여하는가?
  • RQ3자세 신호 통합이 다수의 상호작용 에이전트가 존재하는 혼잡한 장면에서 가짜 양성을 어떻게 감소시키는가?
  • RQ4제안된 모듈러 설계가 재학습이 필요 없이도 최신 기술(SOTA) HOI 검출 모델을 효과적으로 향상시키는가?

주요 결과

  • PMN 모듈은 V-COCO 벤치마크에서 SOTA인 VS-GATs 모델을 2.0 mAP(4.0%) 향상시켜 51.8 mAP를 달성한다.
  • 더 도전적인 HICO-DET 데이터셋에서, 이 방법은 Full 세트에 대해 0.98 mAP(4.6%) 향상, Rare 세트에 대해 1.57 mAP(9.8%) 향상, Non-Rare 세트에 대해 0.75 mAP(3.5%) 향상시킨다.
  • 절단 분석 결과 상대적 공간 특징과 절대 자세 특징 모두가 긍정적인 기여를 하며, 특히 상대적 특징이 더 강한 영향을 미친다.
  • PMN는 혼잡한 장면에서 가짜 양성을 크게 감소시키며, VS-GATs와의 정성적 비교에서 이를 확인할 수 있다.
  • 간단한 MLP를 사용하는 No-Frills Pose Network(NFPN) 기준선은 VS-GATs를 향상시키지만, PMN에 비해 성능이 열 劣하다. 이는 그래프 기반 특징 학습의 유용성을 입증한다.
  • 제안된 모듈은 기존 HOI 모델과 완전히 호환되며, 플러그 앤 플레이 통합이 가능하고 일관된 성능 향상을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.