Skip to main content
QUICK REVIEW

[논문 리뷰] GEN-VLKT: Simplify Association and Enhance Interaction Understanding for HOI Detection

Yue Liao, Aixi Zhang|arXiv (Cornell University)|2022. 03. 26.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

이 논문은 인간-객체 연관을 위한 가이드드 임베딩 메커니즘과 CLIP에서 유도된 시각-언어적 지식 distillation을 통해 상호작용 이해를 향상시키는 쿼리 기반 HOI 검출 프레임워크인 GEN-VLKT를 제안한다. 후처리 매칭을 제거하고 위치 기반 임베딩을 도입함으로써 엔드 투 엔드 연관을 실현하며, CLIP가 제공하는 텍스트 임베딩을 활용해 분류기 초기화를 수행함으로써 최신 기술 성능을 달성한다. 이는 HICO-Det에서 5.05 mAP 향상과 함께 제로샷 일반화 능력 향상에도 기여한다.

ABSTRACT

The task of Human-Object Interaction~(HOI) detection could be divided into two core problems, i.e., human-object association and interaction understanding. In this paper, we reveal and address the disadvantages of the conventional query-driven HOI detectors from the two aspects. For the association, previous two-branch methods suffer from complex and costly post-matching, while single-branch methods ignore the features distinction in different tasks. We propose Guided-Embedding Network~(GEN) to attain a two-branch pipeline without post-matching. In GEN, we design an instance decoder to detect humans and objects with two independent query sets and a position Guided Embedding~(p-GE) to mark the human and object in the same position as a pair. Besides, we design an interaction decoder to classify interactions, where the interaction queries are made of instance Guided Embeddings (i-GE) generated from the outputs of each instance decoder layer. For the interaction understanding, previous methods suffer from long-tailed distribution and zero-shot discovery. This paper proposes a Visual-Linguistic Knowledge Transfer (VLKT) training strategy to enhance interaction understanding by transferring knowledge from a visual-linguistic pre-trained model CLIP. In specific, we extract text embeddings for all labels with CLIP to initialize the classifier and adopt a mimic loss to minimize the visual feature distance between GEN and CLIP. As a result, GEN-VLKT outperforms the state of the art by large margins on multiple datasets, e.g., +5.05 mAP on HICO-Det. The source codes are available at https://github.com/YueLiao/gen-vlkt.

연구 동기 및 목표

  • 기존의 쿼리 기반 HOI 검출기의 인간-객체 연관 및 상호작용 이해 능력의 한계를 해결하기 위해.
  • 이중 브랜치 HOI 검출기에서 복잡한 후처리를 제거하기 위해 위치 기반 임베딩 메커니즘을 도입하여 엔드 투 엔드 연관을 실현하기 위해.
  • CLIP의 사전 훈련된 시각-언어 모델에서 지식을 전이하여 제로샷 및 희귀 카테고리 일반화 능력을 향상시키기 위해.
  • 텍스트 기반 분류기 초기화와 CLIP의 시각적 특징 모방을 통해 상호작용 이해를 향상시키기 위해.
  • 표준 및 제로샷 HOI 검출 벤치마크에서 최신 기술 성능을 달성하기 위해.

제안 방법

  • 인간과 객체 검출을 위한 별도의 쿼리 세트를 가진 이중 브랜치 쿼리 기반 트랜스포머 디코더 아키텍처를 제안한다.
  • 후처리 없이 동일한 공간 위치에 있는 인간 및 객체 쿼리를 연결하기 위해 위치 기반 임베딩(p-GE)을 도입한다.
  • 쌍으로 이루어진 인간 및 객체 쿼리에서 상호작용 쿼리를 생성하여 작업 특화의 특징 학습을 위한 인스턴스 기반 임베딩(i-GE)을 설계한다.
  • CLIP의 임bedded 텍스트 특징으로 상호작용 분류기를 초기화하는 시각-언어 지식 전이(VLKT) 전략을 적용하여 사전 지식 통합을 구현한다.
  • CLIP의 시각적 특징과 HOI 검출기의 시각적 특징 간의 분포 격차를 최소화하기 위해 미미 손실(mimic loss)을 적용한다.
  • L1 손실을 미미 손실 구성 요소에 사용하며, 이는 L2나 병합된 손실보다 더 우수한 성능을 보이는 경험적 결과를 얻는다.

실험 결과

연구 질문

  • RQ1쿼리 기반 HOI 검출기에서 후처리를 제거하면서도 연관 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ2CLIP의 시각-언어 사전 훈련이 희귀 또는 미사용 동사 및 객체에 대해 상호작용 이해를 어떻게 향상시킬 수 있는가?
  • RQ3CLIP 임베딩된 텍스트 표현으로 상호작용 분류기를 초기화하면 HOI 데이터셋의 장긴 분포 문제를 완화할 수 있는가?
  • RQ4CLIP에서 밀도 예측 HOI 검출기로 지식 전이를 위한 최적의 손실 함수는 무엇인가?
  • RQ5제안된 프레임워크는 미사용 동사나 객체가 포함된 제로샷 설정으로 얼마나 잘 일반화되는가?

주요 결과

  • GEN-VLKT는 HICO-Det 데이터셋에서 이전 최고 기술 대비 5.05 mAP 향상을 달성한다.
  • 희귀 우선 설정(rare-first setting)에서 GEN-VLKT는 mAP를 13.16에서 21.36으로 향상시켜 베이스라인 대비 8.84 mAP의 상대적 향상을 기록한다.
  • 미사용 객체 검출에서 GEN-VLKT는 ATL 대비 95.95%의 상대적 mAP 향상을 기록했으며, 미사용 카테고리 설정에서는 108.12%의 상승을 기록한다.
  • 미사용 동사(UV) 설정에서 GEN-VLKT는 베이스라인 대비 55.03%의 상대적 mAP 향상을 달성하여 강력한 제로샷 일반화 능력을 입증한다.
  • 제거 실험(ablation study) 결과, L1 미미 손실이 L2 및 병합된 손실보다 우수하며, 1.66 mAP의 향상을 이룬다.
  • i-GE나 p-GE를 제거할 경우 각각 1.05 및 0.65 mAP의 심각한 mAP 감소가 발생하여, 이들이 특징 분리 및 연관에 핵심적인 역할을 한다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.