Skip to main content
QUICK REVIEW

[논문 리뷰] Relational Context Learning for Human-Object Interaction Detection

Sanghyun Kim, Deunsol Jung|arXiv (Cornell University)|2023. 04. 11.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 인간-물체 상호작용(HOI) 검출을 위한 세 분지형 트랜스포머 기반 방법인 MUREN을 제안한다. 다중 관계적 맥락 학습을 통해 상호관계 추론 능력을 향상시킨다. 인간, 물체, 상호작용 토큰 간의 단항, 이항, 삼항 관계를 모델링하고, 주의 기반 융합 모듈을 통해 맥락을 선택적으로 전파함으로써, HICO-DET 및 V-COCO 벤치마크에서 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

Recent state-of-the-art methods for HOI detection typically build on transformer architectures with two decoder branches, one for human-object pair detection and the other for interaction classification. Such disentangled transformers, however, may suffer from insufficient context exchange between the branches and lead to a lack of context information for relational reasoning, which is critical in discovering HOI instances. In this work, we propose the multiplex relation network (MUREN) that performs rich context exchange between three decoder branches using unary, pairwise, and ternary relations of human, object, and interaction tokens. The proposed method learns comprehensive relational contexts for discovering HOI instances, achieving state-of-the-art performance on two standard benchmarks for HOI detection, HICO-DET and V-COCO.

연구 동기 및 목표

  • 기존의 두 분지형 트랜스포머 기반 HOI 검출 방법에서 디코더 분지 간의 제한된 맥락 교환 문제를 해결한다.
  • 분리된 아키텍처에서 상호작용 인식 맥락이 부족해 발생하는 관계 추론 능력의 부족을 극복한다.
  • 인간, 물체, 상호작용 토큰 간의 풍부한 다수 수준의 관계적 맥락(단항, 이항, 삼항)을 모델링하여 HOI 검출 성능을 향상시킨다.
  • 인간 검출, 물체 검출, 상호작용 분류를 위한 더 구별력 있는 특징을 학습하기 위해 세 분지 아키텍처를 설계한다.
  • 작업별 토큰 조건화와 채널 별 주의를 활용한 주의 기반 융합 메커니즘을 통해 분지 간 효과적이고 작업에 특화된 맥락 교환을 가능하게 한다.

제안 방법

  • 인간, 물체, 상호작용 토큰에서 단항, 이항, 삼항 관계적 맥락을 계산하는 다중 관계 임베딩 모듈(MURE)을 제안한다.
  • 단항 맥락은 각 토큰 유형 내부의 자기주의(예: 상호작용 전용 맥락)로 모델링하고, 이항 맥락은 두 유형 간의 교차주의(예: 인간-상호작용)로 모델링하며, 삼항 맥락은 세 유형의 공동 표현으로 모델링한다.
  • 작업별 토큰 조건화와 채널 별 주의를 활용해 각 하위 작업에 적절한 맥락 정보를 선택하는 주의 기반 융합 모듈을 도입한다.
  • 각 분지의 작업별 토큰과 선택된 관계적 맥락을 요소별 덧셈으로 융합하여, 타겟된 맥락 교환을 가능하게 한다.
  • 세 분지형 트랜스포머 디코더 아키텍처를 채택한다: 하나는 인간 검출을 위해, 하나는 물체 검출을 위해, 하나는 상호작용 분류를 위해 전용으로 사용한다.
  • 표준 HOI 검출 손실을 사용해 엔드 투 엔드로 훈련하며, 다중 작업 학습을 통해 검출 및 분류 헤드를 최적화한다.
Figure 1 : The illustration of relation context information in an HOI instance. We define three types of relation context information in an HOI instance: unary, pairwise, and ternary relation contexts. Each relation context provides useful information for detecting an HOI instance. For example, in o
Figure 1 : The illustration of relation context information in an HOI instance. We define three types of relation context information in an HOI instance: unary, pairwise, and ternary relation contexts. Each relation context provides useful information for detecting an HOI instance. For example, in o

실험 결과

연구 질문

  • RQ1다양한 수준의 관계적 맥락(단항, 이항, 삼항)을 모델링하면 HOI 검출 성능 향상에 기여하는가?
  • RQ2주의 기반 융합 모듈을 통한 선택적 맥락 전파가 HOI 검출에서 관계 추론 능력을 향상시키는가?
  • RQ3세 분지 아키텍처는 두 분지 또는 단일 분지 설계에 비해 특징의 구별력과 성능 측면에서 어떻게 비교되는가?
  • RQ4인간과 물체 분지 간의 파rameter 공유를 피하는 것이 검출 정확도 향상에 얼마나 기여하는가?
  • RQ5분지 간 풍부한 맥락 교환은 분리된 트랜스포머의 관계 추론 능력에 대한 한계를 완화하는가?

주요 결과

  • MUREN은 HICO-DET에서 AP 68.8, V-COCO에서 AP 71.0을 기록하여 기존 방법들을 능가하는 최신 기술 성능을 달성한다.
  • 절단 실험 결과, 주의 기반 융합 모듈을 제거하면 HICO-DET에서 2.25%p, V-COCO에서 2.04%p 성능 저하가 발생하여 그 효과성을 입증한다.
  • 융합 모듈에서 '조건화'와 '채널 주의'의 조합이 가장 높은 성능을 내며, 하위 작업이 서로 다른 맥락이 필요함을 확인한다.
  • 인간과 물체 분지 간 파라미터 공유가 성능을 심각하게 떨어뜨린다—MUREN-(6)은 공유되지 않은 MUREN-(0) 대비 HICO-DET에서 2.2%p, V-COCO에서 1.9%p 성능 저하를 보였다.
  • 시각화 결과 상호작용 분지가 상호작용 발생 영역에 주의를 기울이고, MURE 모듈이 통합적 관계 영역을 강조함을 확인하여, 관계 추론에서의 기여를 검증한다.
  • 완전한 분리 구조(MUREN-(0))는 공유 레이어가 있는 파라미터 수가 동일한 변형(MUREN†)보다 더 높은 정확도를 기록하여, 전용 인간 및 물체 인코더의 이점을 입증한다.
Figure 2 : The overall architecture of MUREN. The proposed method adopts three-branch architecture: human branch, object branch, and interaction branch. Each branch is responsible for human detection, object detection, interaction classification. The input image is fed into the CNN backbone followed
Figure 2 : The overall architecture of MUREN. The proposed method adopts three-branch architecture: human branch, object branch, and interaction branch. Each branch is responsible for human detection, object detection, interaction classification. The input image is fed into the CNN backbone followed

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.