[논문 리뷰] HOICLIP: Efficient Knowledge Transfer for HOI Detection with Vision-Language Models
HOICLIP는 지식 distillation을 거치지 않고 CLIP으로부터 직접 공간적, 동사적, 언어적 사전 지식을 추출하는 지식 전이 프레임워크를 제안한다. 교차 attention 상호작용 디코더, 동사 표현을 위한 시각적 의미 산술, 학습이 없는 프롬프트 기반 분류기를 통해 HICO-Det에서 4.04 mAP 향상과 소수 및 제로샷 설정에서 뛰어난 데이터 효율성을 달성한다.
Human-Object Interaction (HOI) detection aims to localize human-object pairs and recognize their interactions. Recently, Contrastive Language-Image Pre-training (CLIP) has shown great potential in providing interaction prior for HOI detectors via knowledge distillation. However, such approaches often rely on large-scale training data and suffer from inferior performance under few/zero-shot scenarios. In this paper, we propose a novel HOI detection framework that efficiently extracts prior knowledge from CLIP and achieves better generalization. In detail, we first introduce a novel interaction decoder to extract informative regions in the visual feature map of CLIP via a cross-attention mechanism, which is then fused with the detection backbone by a knowledge integration block for more accurate human-object pair detection. In addition, prior knowledge in CLIP text encoder is leveraged to generate a classifier by embedding HOI descriptions. To distinguish fine-grained interactions, we build a verb classifier from training data via visual semantic arithmetic and a lightweight verb representation adapter. Furthermore, we propose a training-free enhancement to exploit global HOI predictions from CLIP. Extensive experiments demonstrate that our method outperforms the state of the art by a large margin on various settings, e.g. +4.04 mAP on HICO-Det. The source code is available in https://github.com/Artanic30/HOICLIP.
연구 동기 및 목표
- CLIP에서 지식 distillation을 통해 유도된 기존의 HOI 검출 방법의 낮은 데이터 효율성과 제로샷 일반화 능력 문제를 해결하기 위해.
- 대규모 애너테이션 훈련 데이터에 의존하지 않고도 긴 꼬리 동사 클래스와 희귀 상호작용에서의 성능을 향상시키기 위해.
- HOI 분류에 대해 CLIP의 사전 학습된 시각-언어 표현을 효과적으로, 학습 없이 활용할 수 있도록 하기 위해.
- 지식 통합 블록을 통해 CLIP의 공간적 및 언어적 사전 지식을 검출 백본과 융합하여 검출 정확도를 향상시키기 위해.
제안 방법
- Transformer 기반의 상호작용 디코더는 교차 attention을 사용하여 CLIP의 시각적 특징 맵으로부터 국소화된 상호작용 특징을 추출하며, 정보가 풍부한 영역에 집중한다.
- 시각적 의미 산술을 활용하여 CLIP가 학습한 시각-의미 관계에서 클래스 가중치를 계산함으로써, 대규모 동사 전용 데이터에 의존하지 않는 동사 분류기를 구성한다.
- 세부 상호작용의 구분 능력을 향상시키기 위해 경량의 동사 표현 어댑터를 도입한다.
- 학습이 없는 향상 기법은 추론 시점에 프롬프트 기반 언어 표현을 통합하여 CLIP의 텍스트 인코더를 활용해 제로샷 예측을 생성한다.
- 지식 통합 블록은 CLIP의 공간적 및 언어적 특징을 검출 백본의 특징과 융합하여 인간-객체 쌍의 국소화 및 상호작용 분류를 향상시킨다.
- CLIP의 사전 학습된 사전 지식을 비시각적, 언어적, 공간적 모odal에서 직접 추출하고 활용함으로써 지식 distillation을 회피한다.

실험 결과
연구 질문
- RQ1지식 distillation과 비교해 CLIP의 사전 학습된 지식을 직접 추출하는 것이 HOI 검출에서 데이터 효율성을 향상시키는가?
- RQ2긴 꼬리 및 저자료 환경에서 시각적 의미 산술이 동사 표현 학습을 어떻게 향상시킬 수 있는가?
- RQ3학습이 없는 프롬프트 기반 텍스트 분류기가 HOI 검출에서 제로샷 일반화 능력을 향상시키는가?
- RQ4CLIP의 공간적 및 언어적 사전 지식을 융합할 경우, 전체, 희귀, 비희귀 클래스 전반에 걸쳐 검출 정확도와 강건성이 얼마나 향상되는가?
주요 결과
- HOICLIP는 완전한 지도 학습 설정에서 HICO-Det 데이터셋에서 이전 최고 성능 대비 +4.04 mAP 향상을 달성한다.
- 모델은 뛰어난 데이터 효율성을 보이며, 훈련 데이터를 5%로 줄였을 때조차 GEN-VLKT와 같은 백본을 능가한다.
- 시각적 의미 산술을 활용한 동사 분류기는 전체 클래스 설정에서 문장 기술 방법 대비 1.16 mAP 향상, 평균 HOI 표현 방법 대비 1.45 mAP 향상 달성.
- 상위-k 전역 예측을 활용한 학습이 없는 향상 기법은 평균 mAP를 0.15 포인트 향상시키며, 추론 비용은 최소한이다.
- HOICLIP는 단일 A100 GPU에서 경쟁적인 추론 속도(55.52 ms/img)를 유지하며, 더 높은 성능에도 불구하고 GEN-VLKT 대비 약간의 증가만을 보인다.
- 제거 실험을 통해 공간적 특징 추출, 동사 어댑터, 언어적 향상 기법 등 각 구성 요소가 성능 향상에 점진적으로 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.