Skip to main content
QUICK REVIEW

[논문 리뷰] Is Object Detection Necessary for Human-Object Interaction Recognition?

Ying Jin, Yinpeng Chen|arXiv (Cornell University)|2021. 07. 27.
Multimodal Machine Learning Applications참고 문헌 36인용 수 4
한 줄 요약

이 논문은 객체 검출 또는 인간 키포인트 검출에 의존하지 않고, CLIP 기반 텍스트 임베딩 초기화와 새로운 Log-Sum-Exp Sign (LSE-Sign) 손실 함수를 활용함으로써 최신 기술 수준 성능을 달성하는 검출 불필요 인간-객체 상호작용(HOI) 인식 방법인 DEFR를 제안한다. 객체나 인간 키포인트 검출에 의존하지 않음에도 불구하고 HICO에서 60.5 mAP을 기록하여 검출 지도 학습 방법보다 13.4 mAP 높게 성능을 내며, 이미지-텍스트 사전학습과 구조화된 다중 레이블 학습이 검출 지도 학습을 제거하면서도 정확도를 향상시킬 수 있음을 보여준다.

ABSTRACT

This paper revisits human-object interaction (HOI) recognition at image level without using supervisions of object location and human pose. We name it detection-free HOI recognition, in contrast to the existing detection-supervised approaches which rely on object and keypoint detections to achieve state of the art. With our method, not only the detection supervision is evitable, but superior performance can be achieved by properly using image-text pre-training (such as CLIP) and the proposed Log-Sum-Exp Sign (LSE-Sign) loss function. Specifically, using text embeddings of class labels to initialize the linear classifier is essential for leveraging the CLIP pre-trained image encoder. In addition, LSE-Sign loss facilitates learning from multiple labels on an imbalanced dataset by normalizing gradients over all classes in a softmax format. Surprisingly, our detection-free solution achieves 60.5 mAP on the HICO dataset, outperforming the detection-supervised state of the art by 13.4 mAP

연구 동기 및 목표

  • 객체 검출이 고성능의 인간-객체 상호작용 인식에 필수적인가를 탐구하는 것.
  • 객체 및 인간 키포인트 검출 지도 학습을 제거함으로써 HOI 인식 파이프라인을 단순화하는 것.
  • 효율적인 이미지-텍스트 사전학습과 새로운 다중 레이블 손실 함수를 활용해 검출 불필요한 HOI 인식을 향상시키는 것.
  • 검출 불필요 방법이 검출 지도 학습 기반 최신 기술 수준 방법을 초월할 수 있음을 입증하는 것.

제안 방법

  • ImageNet 또는 CLIP에서 사전학습된 비전 트랜스포머 백본을 사용하며, 선형 분류기 헤드를 인간-객체 상호작용 클래스 레이블의 텍스트 임베딩으로 초기화한다.
  • CLIP의 텍스트 인코더를 활용해 분류기 초기화를 위한 클래스 레이블 임베딩을 생성하며, 이는 이미지 전용 사전학습 백본에서도 성능을 크게 향상시킨다.
  • 모든 클래스에 대해 소프트맥스 유사 방식으로 기울기를 정규화하는 Log-Sum-Exp Sign (LSE-Sign) 손실 함수를 도입하여, 불균형한 데이터셋에서 다중 레이블 학습을 더 잘 가능하게 한다.
  • 피지컬 테이닝 중 LSE-Sign 손실을 적용하여 가장 문제적(손실이 높은) 클래스에 주의를 기울이게 하여, 모든 HOI 카테고리에 걸쳐 일반화 성능을 향상시킨다.
  • LSE-Sign 손실에서 기울기 크기를 제어하는 스칼라 하이퍼파라미터 γ를 사용하며, 최적의 성능은 γ=100에서 달성된다.
  • 이중 단계 훈련 파이프라인을 적용: 첫 번째 단계에서 사전에 인코딩된 텍스트 임베딩으로 분류기를 초기화하고, 두 번째 단계에서 LSE-Sign 손실을 사용해 전체 모델을 피지컬 테이닝한다.

실험 결과

연구 질문

  • RQ1객체 또는 인간 키포인트 검출 지도 학습 없이도 인간-객체 상호작용 인식을 효과적으로 수행할 수 있는가?
  • RQ2CLIP과 같은 이미지-텍스트 사전학습 기술이 분류기 초기화에 사용될 경우, 검출 불필요한 HOI 인식에서 성능 향상에 기여하는 방식은 무엇인가?
  • RQ3새로운 손실 함수가 클래스 불균형이 있는 다중 레이블 HOI 인식에서 기존의 이진 교차 엔트로피보다 우수한 성능을 낼 수 있는가?
  • RQ4텍스트 임베딩 초기화와 구조화된 다중 레이블 손실 함수의 조합이 검출 지도 학습 기반 방법보다 뛰어난 성능을 내는가?

주요 결과

  • DEFR는 이미지-텍스트 사전학습과 LSE-Sign 손실만을 사용하여 HICO 데이터셋에서 60.5 mAP를 달성하며, 검출 지도 학습 기반 최신 기술 수준(47.1 mAP)보다 13.4 mAP 높은 성능을 기록한다.
  • CLIP 사전학습된 ViT-B/32 백본을 사용할 경우, CLIP의 텍스트 인코더를 활용한 분류기 초기화로 인해 무작위 초기화 대비 성능이 23.7 mAP 향상된다.
  • LSE-Sign 손실은 이진 교차 엔트로피, 가중치 BCE, 포칼 손실보다 우수하며, 최고의 모델에서 LSE-Sign은 60.5 mAP, BCE는 57.9 mAP를 기록한다.
  • LSE-Sign 손실의 최적의 스칼라 γ는 100이며, 이때 60.5 mAP를 달성한다. 이 값 이외의 경우 성능이 크게 떨어진다.
  • BERT 또는 CLIP 텍스트 인코더를 사용한 임베딩 초기화로 인해, ImageNet 사전학습된 이미지 백본을 사용할 때조차 성능이 10+ mAP 향상된다.
  • CLIP, ImageNet-1K, ImageNet-21K를 포함한 모든 테스트된 사전학습 백본에서 최신 기술 수준 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.