[논문 리뷰] Weakly-supervised HOI Detection via Prior-guided Bi-level Representation Learning
이 논문은 이미지 수준 및 HOI 인스턴스 수준의 사전 지식을 지식 백업과 자기 학습된 관련성 분류를 통해 활용함으로써, 약한 감독 하의 HOI 검출을 위한 CLIP 유도 이중 수준 표현 학습 프레임워크를 제안한다. HICO-DET 및 V-COCO에서 최신 기술 수준(SOTA) 성능을 달성하며, 희귀하고 세분화된 상호작용에서 정확도를 크게 향상시키고 노이즈가 많은 인간-객체 연관성을 감소시킨다.
Human object interaction (HOI) detection plays a crucial role in human-centric scene understanding and serves as a fundamental building-block for many vision tasks. One generalizable and scalable strategy for HOI detection is to use weak supervision, learning from image-level annotations only. This is inherently challenging due to ambiguous human-object associations, large search space of detecting HOIs and highly noisy training signal. A promising strategy to address those challenges is to exploit knowledge from large-scale pretrained models (e.g., CLIP), but a direct knowledge distillation strategy~\citep{liao2022gen} does not perform well on the weakly-supervised setting. In contrast, we develop a CLIP-guided HOI representation capable of incorporating the prior knowledge at both image level and HOI instance level, and adopt a self-taught mechanism to prune incorrect human-object associations. Experimental results on HICO-DET and V-COCO show that our method outperforms the previous works by a sizable margin, showing the efficacy of our HOI representation.
연구 동기 및 목표
- 약한 감독 하의 HOI 검출에서 발생하는 모호한 인간-객체 연관성, 큰 검색 공간, 노이즈가 많은 이미지 수준의 감독과 같은 과제를 해결하기 위해.
- CLIP에서 유래한 사전 지식을 활용하여 세분화되고 긴 꼬리 분포를 가진 HOI 클래스에 대한 표현 학습을 향상시키기 위해.
- 상호작용 의미를 포착하기에 부족한 객체 검출기 특징에 대한 의존도를 줄이기 위해.
- 자기 학습 메커니즘을 통해 잘못된 연관성을 정제함으로써 데이터셋 편향과 노이즈가 많은 제안을 완화하기 위해.
- 이미지 수준과 쌍 수준에서 모두 HOI 표현을 향상시키는 이중 수준 지식 통합 전략을 개발하기 위해.
제안 방법
- 전역 브랜치는 CLIP의 시각적 및 텍스트적 임베딩을 사용하여 이미지 수준의 HOI 예측을 생성하고 관계 지식 백업을 구축한다.
- 국소 브랜치는 새로운 주의 메커니즘을 통해 CLIP 유도 지식 백업을 활용하여 인간-객체 제안 특징을 향상시킨다.
- 지식 전이 네트워크(KTN)는 지식 백업과 영역 기반 특징을 융합하여 쌍 수준의 상호작용 표현을 풍부하게 한다.
- 자기 학습된 관련성 분류(SRC) 헤드는 인간-객체 쌍이 의미적으로 관련이 있는지 예측하여 관련이 없는 연관성을 억제한다.
- 최종 HOI 점수는 전역 브랜치와 쌍 수준 브랜치의 점수를 융합하며, 훈련은 오직 이미지 수준의 레이블로만 수행된다.
- 시각적 인코더와 지식 백업은 CLIP에서 초기화되어 강력한 일반화 능력과 사전 지식 통합을 보장한다.

실험 결과
연구 질문
- RQ1이미지 수준의 레이블만 존재할 때, CLIP 기반의 사전 지식이 약한 감독 하의 HOI 검출 성능을 향상시킬 수 있는가?
- RQ2이미지 수준과 인스턴스 수준 간의 이중 수준 지식 통합은 세분화된 HOI 인식을 위한 표현 학습을 어떻게 향상시키는가?
- RQ3자기 학습된 관련성 분류 헤드는 약한 감독 환경에서 노이즈가 많은 인간-객체 연관성을 효과적으로 억제하는가?
- RQ4일반화 능력과 긴 꼬리 분포에 대한 강건성 측면에서, CLIP 초기화가 무작위 초기화 또는 검출기 미리 훈련된 초기화보다 우수한가?
- RQ5제안된 방법은 이전 연구 대비 희귀하고 모호한 HOI 클래스에서 성능을 얼마나 향상시키는가?
주요 결과
- 제안된 방법은 HICO-DET에서 38.79 Full mAP로 새로운 최신 기술 수준을 달성하였으며, 이는 이전의 약한 감독 방법들보다 뚜렷이 뛰어난 성능을 보였다.
- V-COCO에서의 성능은 33.88 Full mAP를 기록하여 다양한 벤치마크 간의 강력한 일반화 능력을 입증하였다.
- KTN과 함께 사용할 경우, 자기 학습된 관련성 분류(SRC) 헤드는 Full mAP를 0.49 향상시켰으며, 잘못된 연관성의 효과적인 정제를 보여주었다.
- 희귀 HOI 클래스에서의 모델 성능은 16.20 mAP를 기록하여 기준 모델 대비 0.63 mAP 향상되었으며, 긴 꼬리 분포에 대한 개선된 처리 능력을 시사한다.
- 지식 백업의 무작위 초기화는 희귀 클래스 mAP를 16.20에서 15.57로 감소시켰으며, CLIP 기반 초기화의 중요성을 확인하였다.
- 정성적 결과는 희귀 HOI 예측에 대한 신뢰도 향상과 의미적으로 유사한 상호작용(예: repair_truck 대비 inspect_truck) 간의 더 나은 구분 능력을 보여주었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.