Skip to main content
QUICK REVIEW

[논문 리뷰] Reformulating HOI Detection as Adaptive Set Prediction

Chen Ming-fei, Yue Liao|arXiv (Cornell University)|2021. 03. 10.
Multimodal Machine Learning Applications참고 문헌 45인용 수 11
한 줄 요약

이 논문은 가용 가능한 인간-물체 상호작용(HOI) 감지 프레임워크인 AS-Net을 제안한다. 이는 학습 가능한 상호작용 쿼리 임베딩과 트랜스포머 기반 디코더를 사용하여 상호작용 감지를 적응형 세트 예측 문제로 재구성한다. 전역적 맥락 특징에 적응적으로 주목하면서, 미분 가능한 매칭을 통해 예측값을 정답과 매칭함으로써 AS-Net은 인간 자세나 언어 특징에 의존하지 않고도 HICO-DET에서 31% 상대적 mAP 향상을 달성하여 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Determining which image regions to concentrate on is critical for Human-Object Interaction (HOI) detection. Conventional HOI detectors focus on either detected human and object pairs or pre-defined interaction locations, which limits learning of the effective features. In this paper, we reformulate HOI detection as an adaptive set prediction problem, with this novel formulation, we propose an Adaptive Set-based one-stage framework (AS-Net) with parallel instances and interaction branches. To attain this, we map a trainable interaction query set to an interaction prediction set with a transformer. Each query adaptively aggregates the interaction-relevant features from global contexts through multi-head co-attention. Besides, the training process is supervised adaptively by matching each ground truth with the interaction prediction. Furthermore, we design an effective instance-aware attention module to introduce instructive features from the instance branch into the interaction branch. Our method outperforms previous state-of-the-art methods without any extra human pose and language features on three challenging HOI detection datasets. Especially, we achieve over $31\%$ relative improvement on a large-scale HICO-DET dataset. Code is available at https://github.com/yoyomimi/AS-Net.

연구 동기 및 목표

  • 고정된 상호작용 위치로 인해 특징 적응성이 제한되는 일단계 HOI 검출기의 한계를 해결하기 위해.
  • 전역 이미지 특징으로부터 동적이고 맥락 인식형 주목을 가능하게 하여 상호작용 특징 학습을 향상시키기 위해.
  • 높은 성능를 유지하면서도 인간 자세나 언어 임베딩과 같은 외부 신호에 의존하지 않기 위해.
  • 병렬 인스턴스 및 상호작용 브랜치를 갖춘 통합형 엔드 투 엔드 일단계 프레임워크를 설계하여 효율적이고 정확한 HOI 감지 구현하기 위해.

제안 방법

  • 트랜스포머 기반 상호작용 디코더를 통해 학습 가능한 상호작용 쿼리 세트를 상호작용 예측 세트로 매핑한다.
  • 상호작용 쿼리와 전역 이미지 특징 간의 멀티헤드 공주의 주목을 통해 상호작용 관련 맥락을 적응적으로 통합한다.
  • 예측된 상호작용 세트와 정답 트리플릿 간의 미분 가능한 매칭을 통해 적응형 감독을 수행한다.
  • 공주의 주목을 통해 인스턴스 수준 특징을 상호작용 브랜치에 통합하기 위해 인스턴스 인식 주목 모듈을 통합한다.
  • 이중 브랜치 아키텍처를 활용한다: 하나는 인스턴스 검출(위치 및 카테고리)을 위해, 다른 하나는 상호작용 예측(벡터 및 동사 카테고리)을 위해.
  • 인간 중심에서 물체 중심으로 향하는 상호작용 벡터를 사용하여 예측값과 검출된 인스턴스를 연결한다.

실험 결과

연구 질문

  • RQ1HOI 감지를 적응형 세트 예측으로 재구성함으로써 특징의 관련성과 상호작용 정확도가 향상될 수 있는가?
  • RQ2공주의 주목을 통해 전역 맥락에서 상호작용 쿼리를 학습하는 것이 고정 위치 예측보다 일단계 HOI 검출기에서 더 우수한 성능을 내는가?
  • RQ3예측값을 정답과 매칭함으로써 적응형 감독을 수행하면 외부 감독 없이도 모델 일반화 능력이 향상되는가?
  • RQ4인스턴스 인식 주목이 인스턴스 수준 특징을 상호작용 예측에 통합하는 데 얼마나 효과적인가?
  • RQ5인간 자세나 언어 특징에 의존하지 않고도 일단계 HOI 검출기가 SOTA 성능을 달성할 수 있는가?

주요 결과

  • AS-Net은 이전 최신 기술 수준 방법에 비해 대규모 HICO-DET 데이터셋에서 31% 상대적 mAP 향상을 달성한다.
  • 인스턴스 인식 주목 모듈은 기본 모델에서 mAP를 0.44점 향상시키며, 의미 임베딩과 결합할 경우 1.12점 향상된다.
  • 의미 임베딩과 인스턴스 인식 주목 모듈을 모두 갖춘 모델은 의미 임베딩만 있는 기준 모델 대비 1점의 성능 향상을 기록한다.
  • 제거 실험 결과, 6층의 상호작용 디코더와 6개의 인스턴스 인식 주목 모듈 조합이 파라미터 효율성과 균형을 고려할 때 최적의 성능을 내는 것으로 확인되었다.
  • 질적 주목 시각화 결과, 모델이 관련 있는 신체 부위와 물체(예: 우산, 손)에 집중하는 반면 불필요한 특징은 회피함을 확인하여 향상된 특징 선택성의 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.