Skip to main content
QUICK REVIEW

[논문 리뷰] Open-world Text-specified Object Counting

Niki Amini-Naieni, Kiana Amini-Naieni|arXiv (Cornell University)|2023. 06. 02.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 시각적 예시 없이 이미지와 자연어 설명에서 직접 객체 수를 예측하는 단일 단계, 클래스 무관의 트랜스포머 기반 모델인 CounTX를 제안한다. 이는 개방 세계의 텍스트 기반 객체 수세기 문제를 해결하며, FSC-147 벤치마크에서 이전의 이단계 방법을 능가하고, 더 풍부한 텍스트 기반 설명을 포함한 개선된 데이터셋 FSC-147-D를 도입한다.

ABSTRACT

Our objective is open-world object counting in images, where the target object class is specified by a text description. To this end, we propose CounTX, a class-agnostic, single-stage model using a transformer decoder counting head on top of pre-trained joint text-image representations. CounTX is able to count the number of instances of any class given only an image and a text description of the target object class, and can be trained end-to-end. In addition to this model, we make the following contributions: (i) we compare the performance of CounTX to prior work on open-world object counting, and show that our approach exceeds the state of the art on all measures on the FSC-147 benchmark for methods that use text to specify the task; (ii) we present and release FSC-147-D, an enhanced version of FSC-147 with text descriptions, so that object classes can be described with more detailed language than their simple class names. FSC-147-D and the code are available at https://www.robots.ox.ac.uk/~vgg/research/countx.

연구 동기 및 목표

  • 목표 클래스가 사전에 정의되지 않은 개방 세계 객체 수세기 문제를 해결하기 위해, 추론 시점에 목표 클래스를 지정할 수 있도록 하는 것.
  • 시각적 예시(예: 바운딩 박스)를 인간이 제공할 필요 없이 자연어 설명만으로 개방 세계 수세기에서의 시각적 예시를 제거하는 것.
  • 미리 정의되지 않은 객체 클래스에 일반화할 수 있는 단일 단계, 엔드 투 엔드로 학습 가능한 모델을 개발하는 것.
  • 더 복잡하고 현실적인 수세기 작업을 지원하기 위해 FSC-147 벤치마크에 세부적인 텍스트 기반 설명을 추가하여 개선하는 것.
  • 이미지 및 텍스트 인코더의 다양한 미세조정 전략이 수세기 맥락에서 어떻게 영향을 미치는지 평가하는 것.

제안 방법

  • CounTX는 사전 훈련된 CLIP 기반의 공동 이미지-텍스트 인코더를 사용하여 입력 이미지와 텍스트 설명을 동일한 임bedding 공간에 매핑한다.
  • 트랜스포머 디코더를 활용해 텍스트 임베딩과 이미지 패치 특징 간의 교차 attention을 계산하여 관련 객체 영역을 국소화하는 데 유사도를 모델링한다.
  • 결과로 생성된 attention 맵을 이미지 해상도로 업샘플링하고, 이를 밀도 맵으로 디코딩하여 총 객체 수를 예측한다.
  • 예측된 수와 진짜 수, 밀도 맵 간의 L1 및 L2 손실을 조합하여 엔드 투 엔드로 모델을 훈련한다.
  • 텍스트 인코더를 고정하고 이미지 인코더만 미세조정하는 것이 성능을 최적화하며, 이는 분석 실험을 통해 검증되었다.
  • 모델은 CLIP의 제로샷 일반화 능력을 활용하면서도, 수세기 작업에 특화된 시각적 인코더를 미세조정을 통해 적응시킨다.

실험 결과

연구 질문

  • RQ1시각적 예시가 필요 없이 자연어 설명만으로 개방 세계의 텍스트 기반 객체 수세기에서 최첨단 성능을 달성할 수 있는 단일 단계, 엔드 투 엔드 모델이 가능한가?
  • RQ2이미지 및 텍스트 인코더의 고정 또는 미세조정 전략 선택이 수세기 성능에 어떤 영향을 미치는가?
  • RQ3사전 훈련된 CLIP 기반 모델이 자연어 설명만으로 객체 수를 얼마나 잘 일반화할 수 있는가?
  • RQ4FSC-147 벤치마크에 세부적인 텍스트 기반 설명을 추가함으로써 모델의 일반화 능력과 평가의 견고성이 향상되는가?
  • RQ5단일 이미지 내에서 여러 객체 클래스를 자연어 설명만으로 정확히 구분할 수 있는가?

주요 결과

  • CounTX는 FSC-147 테스트 세트에서 평균 절대 오차(MAE) 15.88과 루트 평균 제곱 오차(RMSE) 106.29를 기록하여, Xu 등(2023)의 이전 이단계 방법보다 모든 지표에서 뛰어난 성능을 보였다.
  • 텍스트 인코더를 고정하고 이미지 인코더만 미세조정하는 것이 최적의 성능을 내며, 이는 전체적으로 미세조정한 설정 대비 MAE를 50% 이상 감소시켰다.
  • 모델은 주어진 텍스트 설명과 일치하는 영역만 강조하는 밀도 맵을 성공적으로 생성하여 의미 기반 정확한 국소화 능력을 입증했다.
  • FSC-147-D 및 CountBench에서의 정성적 결과는 CounTX가 소수의 인스턴스와 복잡한 설명을 가진 이미지에 대해 잘 일반화됨을 보여주었다.
  • 세부적인 텍스트 기반 설명을 포함한 FSC-147-D의 공개는 텍스트 기반 수세기 모델의 더 현실적이고 다양한 평가를 가능하게 했다.
  • 모델는 추론 시점에 미리 정의되지 않은 객체 클래스에 일반화됨을 확인하여, 개방 세계 기능을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.