Skip to main content
QUICK REVIEW

[논문 리뷰] QAHOI: Query-Based Anchors for Human-Object Interaction Detection

Junwen Chen, ‪Keiji Yanai‬|arXiv (Cornell University)|2021. 12. 16.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

QAHOI는 다중 척도 특징 추출과 학습 가능한 쿼리 임베딩을 활용하여 높은 정확도로 HOI 인스턴스를 국소화하고 분류하는 쿼리 기반 트랜스포머 프레임워크를 제안한다. 이는 트랜스포머 기반 백본과 쿼리 기반 앵커를 사용하여 다양한 공간 척도와 거리에서 인간-객체 쌍을 민첩하게 참조함으로써 HICO-DET에서 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

Human-object interaction (HOI) detection as a downstream of object detection tasks requires localizing pairs of humans and objects and extracting the semantic relationships between humans and objects from an image. Recently, one-stage approaches have become a new trend for this task due to their high efficiency. However, these approaches focus on detecting possible interaction points or filtering human-object pairs, ignoring the variability in the location and size of different objects at spatial scales. To address this problem, we propose a transformer-based method, QAHOI (Query-Based Anchors for Human-Object Interaction detection), which leverages a multi-scale architecture to extract features from different spatial scales and uses query-based anchors to predict all the elements of an HOI instance. We further investigate that a powerful backbone significantly increases accuracy for QAHOI, and QAHOI with a transformer-based backbone outperforms recent state-of-the-art methods by large margins on the HICO-DET benchmark. The source code is available at $\href{https://github.com/cjw2021/QAHOI}{ ext{this https URL}}$.

연구 동기 및 목표

  • 기존의 일단에 HOI 검출 방법이 인간-객체 상호작용의 공간적 변동성과 척도 다양성 처리에 한계를 보이는 문제를 해결하기 위해.
  • 다중 척도 특징 맵과 자기주의 메커니즘을 활용하여 거리가 먼 또는 소규모 인간-객체 쌍의 특징 추출을 향상시키기 위해.
  • 공간적 위치에 종속되지 않고 HOI 인스턴스를 국소화하고 분류할 수 있는 민첩한 쿼리 기반 검출 헤드를 개발하기 위해.
  • 강력한 트랜스포머 기반 백본이 HOI 작업의 검출 정확도를 크게 향상시킬 수 있음을 입증하기 위해.
  • 초기 학습에서부터 훈련 가능하고 현대적 객체 검출 패러다임과 호환되는 강력한 일단 기반 기준선을 구축하기 위해.

제안 방법

  • QAHOI는 다양한 공간 해상도에서의 다중 척도 특징을 추출하기 위해 계층적인 트랜스포머 기반 백본을 사용한다.
  • 다중 척도 특징을 참조하기 위해 트랜스포머 인코더를 사용하여 맥락적으로 rich한 시각적 표현을 생성한다.
  • 학습 가능한 쿼리 기반 디코더가 각 쿼리가 잠재적인 HOI 인스턴스에 대응하는 방식으로 HOI 임베딩을 생성한다.
  • 상호작용 헤드는 쿼리 임베딩에서 직접 바운딩 박스, 객체 클래스, 동작 클래스를 예측한다.
  • 고정된 상호작용 지점에 의존하지 않는 쿼리 기반 앵커를 사용하여 다양한 공간 구성에서 민감한 국소화가 가능하다.
  • 표준 HOI 검출 손실을 사용해 엔드 투 엔드로 훈련되며, Swin-Large나 Deformable DETR와 같은 강력한 백본으로 미세조정이 가능하다.
(a) Larger Area
(a) Larger Area

실험 결과

연구 질문

  • RQ1쿼리 기반 트랜스포머 프레임워크는 다양한 공간 척도와 거리에서 인간-객체 상호작용의 검출을 향상시킬 수 있는가?
  • RQ2다중 척도 특징 추출은 HOI 검출에서 소규모 또는 거리가 먼 인간-객체 쌍의 검출에 어떻게 기여하는가?
  • RQ3백본 아키텍처의 선택이 일단에 HOI 검출기 성능에 어느 정도 영향을 미치는가?
  • RQ4쿼리 기반 검출 헤드는 장거리 및 모호한 인간-객체 관계를 포착하는 데 상호작용 지점 기반 방법보다 뛰어나게 작용할 수 있는가?
  • RQ5자기주의를 갖춘 순수 트랜스포머 기반 백본은 CNN 기반 백본보다 HOI 검출에서 명백한 이점을 제공하는가?

주요 결과

  • Swin-Large 백본을 사용한 QAHOI는 HICO-DET 벤치마크에서 최신 기준 성능(SOTA)을 달성하며 최근의 SOTA 방법들을 능가한다.
  • 소규모 HOI 인스턴스(첫 세 개의 박스)에서 QAHOI는 ResNet-101을 사용한 QPIC보다 트랜스포머 백본을 사용해 특히 가장 작은 박스에서 뛰어난 성능을 보였다.
  • Deformable DETR에서 미세조정한 ResNet-50를 사용한 QAHOI도 소규모 인스턴스에서 QPIC의 ResNet-101 성능과 유사한 결과를 달성했다.
  • 다른 방법들이 성능이 저하되는 장거리 HOI 인스턴스(중앙 거리 < 0.3× 이미지 크기)에서도 QAHOI는 강력한 성능 유지를 보였다.
  • 쿼리 기반 앵커는 국소화에서의 민첩성을 보였으며, 앵커가 인간-객체 쌍의 중심에 있지 않더라도 HOI 인스턴스를 탐지할 수 있었다.
  • 상호작용 지점 감독에 의존하지 않고도 높은 정확도를 달성하여, 쿼리 기반 표현이 HOI 검출에 효과적임을 입증했다.
(b) Center Distance
(b) Center Distance

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.