Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Human-Object Interaction Detection with Text-to-Image Diffusion Model

Jie Yang, Bingliang Li|arXiv (Cornell University)|2023. 05. 20.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 고정된 텍스트-이미지 확산 모델을 활용하여 상호작용 표현 학습을 향상시키기 위해 어댑터 스타일 튜닝을 통해 Stable Diffusion와 CLIP의 의미 특징을 조합하는 새로운 인간-객체 상호작용(HOI) 검출 프레임워크인 DiffHOI를 제안한다. 또한 140만장이 넘는 이미지를 포함한 대규모, 클래스 균형 잡힌, 다양한 합성 HOI 데이터셋인 SynHOI를 도입하여 HICO-DET에서 41.50 mAP를 달성하고 희귀 카테고리에서 11.55% mAP 향상을 이룩했으며, 제로샷 및 일반 검출 설정 모두에서 기존 최고 성능(SOTA)을 크게 뛰어넘었다.

ABSTRACT

This paper investigates the problem of the current HOI detection methods and introduces DiffHOI, a novel HOI detection scheme grounded on a pre-trained text-image diffusion model, which enhances the detector's performance via improved data diversity and HOI representation. We demonstrate that the internal representation space of a frozen text-to-image diffusion model is highly relevant to verb concepts and their corresponding context. Accordingly, we propose an adapter-style tuning method to extract the various semantic associated representation from a frozen diffusion model and CLIP model to enhance the human and object representations from the pre-trained detector, further reducing the ambiguity in interaction prediction. Moreover, to fill in the gaps of HOI datasets, we propose SynHOI, a class-balance, large-scale, and high-diversity synthetic dataset containing over 140K HOI images with fully triplet annotations. It is built using an automatic and scalable pipeline designed to scale up the generation of diverse and high-precision HOI-annotated data. SynHOI could effectively relieve the long-tail issue in existing datasets and facilitate learning interaction representations. Extensive experiments demonstrate that DiffHOI significantly outperforms the state-of-the-art in regular detection (i.e., 41.50 mAP) and zero-shot detection. Furthermore, SynHOI can improve the performance of model-agnostic and backbone-agnostic HOI detection, particularly exhibiting an outstanding 11.55% mAP improvement in rare classes.

연구 동기 및 목표

  • 기존 HOI 데이터셋의 장우범 분포 및 다양성 부족 문제를 해결하여 희귀 및 미세한 상호작용 카테고리에 대한 효과적인 학습을 가능하게 하기 위해.
  • 사전 훈련된 텍스트-이미지 확산 모델에서 유래한 풍부한 맥락 인식 표현을 활용하여 HOI 검출에서의 상호작용 예측 불확실성을 줄이기 위해.
  • 완전한 삼중항(annotation, 인간, 객체, 상호작용)을 갖춘 고다양성, 고정밀도 합성 HOI 이미지를 자동으로 생성하는 확장 가능한 파이프라인 개발을 위해.
  • 어댑터 스타일 튜닝을 통해 고정된 확산 모델과 CLIP 모델의 의미 특징을 융합하여 인간 및 객체 표현 학습을 향상시키기 위해.
  • 합성 데이터와 확산 기반 표현이 모델 독립적이고 백본 독립적인 HOI 검출 성능 향상에 기여할 수 있음을 입증하기 위해.

제안 방법

  • 사전 훈련된 객체 검출기와 확산 모델(Stable Diffusion) 및 CLIP의 의미 표현을 융합하는 상호작용 디코더를 통합한 DiffHOI 검출 프레임워크를 제안한다.
  • 확산 모델의 내부 특징 공간에서 동사 연관 맥락 표현($\boldsymbol{V}_{sd}$)을 추출하고, CLIP의 전역 및 국소 표현($\boldsymbol{v}_{clip}$)과 정렬하기 위한 어댑터 스타일 튜닝 방법을 도입한다.
  • 완전히 애너테이션된 삼중항(인간, 객체, 상호작용)을 갖춘 140만장 이상의 합성 HOI 이미지를 자동으로 생성하는 확장 가능한 파이프라인을 설계한다. 이는 클래스 균형과 고다양성을 보장한다.
  • 특징 추출 중 노이즈 수준을 조절하기 위해 확산 시간 단계 $t$를 사용하며, 추론 결과에 따르면 $t=0$(원본 노이즈 이미지)에서 최적의 성능을 기록한다.
  • 일반화 및 희귀 카테고리 검출 향상을 위해 SynHOI와 고품질 서브셋인 SynHOI-Sub를 사용한 사전 훈련 및 공동 훈련 전략을 적용한다.
  • 대비 학습 및 지식 정복 원리를 활용하여 다양한 모델 간 상호작용 표현을 정렬하고 제로샷 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1고정된 텍스트-이미지 확산 모델의 내부 표현이 HOI 검출에 관련된 동사 개념과 그 맥락적 뉘앙스를 효과적으로 포착할 수 있는가?
  • RQ2사전 훈련된 확산 모델의 의미 특징을 어떻게 효과적으로 다운스트림 검출 작업에서 인간-객체 상호작용 표현을 향상시키는 데 활용할 수 있는가?
  • RQ3대규모 합성 클래스 균형 잡힌 HOI 데이터셋이 실제 세계의 HOI 데이터셋에서 장우범 분포 문제를 어느 정도 완화할 수 있는가?
  • RQ4확산 기반 및 CLIP 기반 표현의 통합이 빈도 높은 및 희귀 상호작용 카테고리 모두에서 일관된 mAP 향상을 이끌 수 있는가?
  • RQ5제안된 방법이 아키텍처 수정 없이 다양한 백본과 검출 아키텍처에 일반화 가능한가?

주요 결과

  • DiffHOI는 동일한 평가 프로토콜을 사용한 HICO-DET 벤치마크에서 41.50 mAP를 달성했으며, 이는 이전 최고 성능(33.73 mAP)을 크게 뛰어넘는 결과이다.
  • 희귀 HOI 카테고리(학습 인스턴스 수가 10개 미만)에서 11.55% mAP 향상을 기록하여 장우범 분포에 대한 강력한 일반화 능력을 입증했다.
  • SynHOI-Sub를 사용한 공동 훈련은 DiffHOI 모델에서 0.58 mAP 향상, GEN-VLKT에서는 0.69 mAP 향상으로 이어져 합성 데이터의 일반화 효과를 입증했다.
  • 제거 분석 결과 $t=0$에서 추출한 $\boldsymbol{V}_{sd}$가 최고의 성능을 기록하며, 높은 노이즈 수준($t=500$)에서는 성능 저하가 발생함을 확인하여 초기 확산 단계에서의 특징 추출이 최적임을 입증했다.
  • 확산 모델에서 추출한 $\boldsymbol{V}_{sd}$를 통합함으로써 기준 모델 대비 희귀 mAP가 3.36 mAP 향상되었으며, 이는 미세한 상호작용 의미를 포착하는 데 기여함을 시사한다.
  • SynHOI를 통해 모델 독립적이고 백본 독립적인 성능 향상이 가능했으며, 특히 희귀 카테고리 검출에서 가장 큰 성과를 기록하여 데이터 부족 문제 완화에 실질적인 기여를 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.