Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Human-Object Interaction Detection using Interaction Points

Tiancai Wang, Tong Yang|arXiv (Cornell University)|2020. 03. 31.
Multimodal Machine Learning Applications참고 문헌 53인용 수 35
한 줄 요약

이 논문은 interaction modeling을 상호작용 지점의 키포인트 탐지와 인간/객체 탐지와의 그룹화를 통해 HOI 트리플렛을 예측하는 방식으로 프레이밍하는 완전 합성적 앵커-프리 HOI 탐지기를 제시한다.

ABSTRACT

Understanding interactions between humans and objects is one of the fundamental problems in visual classification and an essential step towards detailed scene understanding. Human-object interaction (HOI) detection strives to localize both the human and an object as well as the identification of complex interactions between them. Most existing HOI detection approaches are instance-centric where interactions between all possible human-object pairs are predicted based on appearance features and coarse spatial information. We argue that appearance features alone are insufficient to capture complex human-object interactions. In this paper, we therefore propose a novel fully-convolutional approach that directly detects the interactions between human-object pairs. Our network predicts interaction points, which directly localize and classify the inter-action. Paired with the densely predicted interaction vectors, the interactions are associated with human and object detections to obtain final predictions. To the best of our knowledge, we are the first to propose an approach where HOI detection is posed as a keypoint detection and grouping problem. Experiments are performed on two popular benchmarks: V-COCO and HICO-DET. Our approach sets a new state-of-the-art on both datasets. Code is available at https://github.com/vaesl/IP-Net.

연구 동기 및 목표

  • Appearance 기반의, 인스턴스 중심 HOI 탐지 아키텍처가 많은 인간-객체 쌍에서 확장될 때 잘 작동하지 않는다는 점을 동기로 삼아 이를 넘어설 필요성을 제시한다.
  • 상호작용 지점과 상호작용 벡터를 기반으로 한 새로운 HOI 표현을 도입하여 상호작용을 직접적으로 위치화하고 분류한다.
  • 상호작용 지점과 벡터를 탐지하고 이를 탐지된 인간/객체와 그룹화하여 HOI 트리플렛을 형성하는 완전 합성 신경망을 개발한다.
  • 각 구성 요소를 검증하는 ablation 연구와 함께 두 벤치마크(V-COCO 및 HICO-DET)에서 최첨단 성능을 달성함을 시연한다.

제안 방법

  • HOI 탐지를 앵커-프리 객체 탐지에서 영감을 얻은 키포인트 탐지 및 그룹화 문제로 제시한다.
  • Hourglass 백본을 사용해 특징을 추출하고 두 개의 병렬 가지를 생성한다: 상호작용 지점 열지도와 부호없는 상호작용 벡터 맵.
  • 양성/음성의 균형을 맞추기 위해 가우시안 감독으로 상호작용 지점 열지도를 학습하고 포컬 유사 손실을 사용한다.
  • 상호작용 벡터를 학습해 인간/객체 중심까지의 절대 수평/수직 길이를 예측한다(부호없는 벡터).
  • 추론 시 상위 k개의 상호작용 지점을 추출하고 상호작용 벡터를 복구한 뒤 상호작용 박스를 형성한다.
  • 인간/객체 박스와의 IoU 및 기준 박스와의 모서리 거리를 확인하는 소프트 제약 스킴을 통해 상호작용 지점을 그룹화한다.

실험 결과

연구 질문

  • RQ1다중 모달의 인스턴스 중심 파이프라인이 아닌 키포인트 탐지 및 그룹화 문제로 HOI 탐지를 효과적으로 형식화할 수 있는가?
  • RQ2전통적인 다중 스트림 방식에 비해 상호작용 지점과 벡터가 HOI 위치 지정 및 분류를 개선하는가?
  • RQ3제안된 상호작용 그룹화 및 보조 구성요소(각도-필터, 거리-비율-필터, 센터-풀)의 HOI 탐지 성능에 대한 영향은 무엇인가?
  • RQ4제안된 방법과 구성요소가 표준 HOI 벤치마크(V-COCO, HICO-DET)에서 확장 가능하고 효과적인가?

주요 결과

  • 제안된 IP-Net은 V-COCO에서 mAP_role 최첨단을 달성한다( HICO-DET 사전 학습 없이 51.0, HICO-DET 사전학습 시 52.3) 그리고 HICO-DET에서 Default 및 Known Object 설정 모두에서.
  • ablation 연구는 상호작용 상자와 모서리-거리 제약이 포함된 상호작용 그룹화 방식이 성능을 크게 향상시킴을 보여준다(예: V-COCO에서 46.2에서 50.5로, 51.0 mAP_role로).
  • Center-pool과 두 가지 분기의 상호작용 생성(지점 열지도 및 부호없는 벡터)은 베이스라인 대비 측정 가능한 향상을 제공하며, 총 절대 성능 향상은 베이스라인 대비 11.4%포인트이다.
  • 이 방법은 이론상으로는 2차원적 보이지만 실제로는 heatmap와 소프트 제약을 통한 필터링으로 거의 선형복잡도(<5 ms)로 효율적인 그룹화를 유지한다.
  • 상호작용 점수에 대한 동적 임계값은 고정 임계값에 비해 HICO-DET에서 희귀 클래스 대비 비희귀 클래스의 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.