Skip to main content
QUICK REVIEW

[논문 리뷰] ZSD-YOLO: Zero-Shot YOLO Detection using Vision-Language KnowledgeDistillation.

Johnathan Xie, Shuai Zheng|arXiv (Cornell University)|2021. 09. 24.
COVID-19 diagnosis using AI참고 문헌 34인용 수 13
한 줄 요약

ZSD-YOLO는 CLIP의 이미지 및 텍스트 임베딩을 수정된 YOLOv5 헤드와 정렬하는 시각-언어 지식 정복 방법을 제안하여, 더 적은 파라미터로 COCO에서 최신 기술 수준의 정확도를 달성하는 제로샷 객체 검출을 가능하게 한다. 이 방법은 재학습 없이도 어떤 새로운 클래스에 대해서도 추론이 가능하며, 추가 데이터 없이 자기학습을 통해 더욱 향상된다.

ABSTRACT

Real-world object sampling produces long-tailed distributions requiring exponentially more images for rare types. Zero-shot detection, which aims to detect unseen objects, is one direction to address this problem. A dataset such as COCO is extensively annotated across many images but with a sparse number of categories and annotating all object classes across a diverse domain is expensive and challenging. To advance zero-shot detection, we develop a Vision-Language distillation method that aligns both image and text embeddings from a zero-shot pre-trained model such as CLIP to a modified semantic prediction head from a one-stage detector like YOLOv5. With this method, we are able to train an object detector that achieves state-of-the-art accuracy on the COCO zero-shot detection splits with fewer model parameters. During inference, our model can be adapted to detect any number of object classes without additional training. We also find that the improvements provided by the scaling of our method are consistent across various YOLOv5 scales. Furthermore, we develop a self-training method that provides a significant score improvement without needing extra images nor labels.

연구 동기 및 목표

  • 희귀 카테고리가 충분한 학습 데이터를 확보하지 못하는 실세계 객체 검출 문제에서의 긴 꼬리 분포 문제를 해결하기 위해.
  • 추가적인 학습 또는 애너테이션 없이도 새로운 객체 카테고리의 제로샷 검출을 가능하게 하기 위해.
  • 더 적은 파라미터로 COCO의 제로샷 분할에서 검출 정확도를 향상시키기 위해.
  • 다양한 YOLOv5 모델 크기 간의 확장성과 일관성을 탐색하기 위해.

제안 방법

  • CLIP의 사전 학습된 시각 및 텍스트 인코더를 활용하여 정렬된 이미지 및 텍스트 임베딩을 추출한다.
  • CLIP의 텍스트 임베딩을 클래스 프로토타입으로 사용하여 수정된 YOLOv5 단일 단계 검출기 헤드가 객체 클래스를 예측하도록 적응시킨다.
  • 검출기의 특징 맵을 CLIP의 이미지-텍스트 대비 표현과 정렬시켜 지식 정복을 수행한다.
  • 추가 이미지나 레이블이 필요 없이 성능을 향상시키는 자기학습 전략을 도입한다.
  • 검출기의 예측과 CLIP의 제로샷 분류 점수 간의 격차를 최소화하는 정복 손실을 사용한다.
  • 학습 기간 동안 전체적으로 적용하여 테스트 시 어떤 새로운 클래스에 대해서도 직접 추론이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1시각-언어 지식 정복이 최소한의 파라미터 오버헤드로 COCO에서 제로샷 객체 검출 정확도를 향상시킬 수 있는가?
  • RQ2제안된 방법이 다양한 YOLOv5 모델 크기에서 제로샷 검출 성능 측면에서 어떻게 확장되는가?
  • RQ3추가 레이블이 없는 조건에서 자기학습이 제로샷 검출 성능을 얼마나 향상시킬 수 있는가?
  • RQ4CLIP 임베딩을 YOLO 기반 검출기 헤드와 정렬함으로써 다양한 객체 카테고리에 걸쳐 일관된 향상이 이루어지는가?
  • RQ5재학습 없이도 어떤 수의 새로운 객체 카테고리에 대해서도 일반화가 가능한가?

주요 결과

  • ZSD-YOLO는 이전 방법보다 더 적은 모델 파라미터로 COCO의 제로샷 검출 벤치마크에서 최신 기술 수준의 정확도를 달성한다.
  • 모델이 모든 YOLOv5 스케일 변형에서 일관된 성능 향상을 유지함으로써 강력한 확장성을 보여준다.
  • 자기학습은 추가 이미지나 애너테이션 없이도 검출 점수를 크게 향상시킨다.
  • 모델은 재학습 없이도 어떤 새로운 객체 카테고리에 대해서도 추론이 가능하여 진정된 제로샷 일반화를 보여준다.
  • 시각-언어 정복 프레임워크는 CLIP의 제로샷 능력을 단일 단계 객체 검출기로 효과적으로 전이한다.
  • 의미적 정렬을 통한 방법으로 희귀하거나 새로운 클래스의 검출이 가능해져, 비용이 많이 드는 데이터 수집 및 애너테이션의 필요성을 줄일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.