[논문 리뷰] Object Counting: You Only Need to Look at One
이 논문은 Self-Attention와 Correlative-Attention를 활용하여 인스턴스 내 및 인스턴스 간 관계를 모델링하고, 다중 척도 특징 추출을 위한 Scale Aggregation 기법을 통합한 새로운 one-shot 객체 수세기 모델인 LaoNet을 제안한다. 이 모델은 단일 지원 예제만으로도 새로운 카테고리의 객체를 수세기하며, FSC-147 및 COCO 벤치마크에서 빠른 수렴 속도와 높은 정확도를 기록하여 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.
This paper aims to tackle the challenging task of one-shot object counting. Given an image containing novel, previously unseen category objects, the goal of the task is to count all instances in the desired category with only one supporting bounding box example. To this end, we propose a counting model by which you only need to Look At One instance (LaoNet). First, a feature correlation module combines the Self-Attention and Correlative-Attention modules to learn both inner-relations and inter-relations. It enables the network to be robust to the inconsistency of rotations and sizes among different instances. Second, a Scale Aggregation mechanism is designed to help extract features with different scale information. Compared with existing few-shot counting methods, LaoNet achieves state-of-the-art results while learning with a high convergence speed. The code will be available soon.
연구 동기 및 목표
- 단일 레이블링된 예제만으로도 새로운, 볼 수 없는 객체 카테고리를 이미지에서 세는 데 도전하는 문제를 해결한다.
- 소수 샘플 수세기 환경에서 도메인 이탈 및 인스턴스 변형(예: 크기, 회전)을 극복한다.
- 세분화 없이도 다양한 객체 카테고리에 대해 효과적으로 일반화할 수 있는 모델을 설계한다.
- 인스턴스 내 및 인스턴스 간 특징 상관관계를 모델링하여 one-shot 수세기에서의 정확도와 강건성을 향상시킨다.
- 기존 소수 샘플 수세기 모델 대비 더 빠른 수렴 속도와 안정적인 학습 성능을 달성한다.
제안 방법
- 쿼리 이미지 내 특징 간 내부 관계와 쿼리 및 지원 특징 간 외부 관계를 학습하기 위해 Self-Attention과 Correlative-Attention을 조합한 특징 상관관계 모듈을 도입한다.
- Self-Attention을 사용해 쿼리 이미지 및 지원 박스 내 특징을 개선하여 주목할 만한 영역과 그들의 공간적 의존성을 강조한다.
- 지원 영역에서 다중 척도 특징을 추출하고 공간 일관성을 유지하면서 융합하는 Scale Aggregation 기법을 구현한다.
- 어텐션 계산 중 공간 구조를 유지하기 위해 평탄화된 특징에 위치 임베딩을 적용한다.
- 최종 밀도 맵을 예측하기 위해 밀도 회귀기(density regressor)를 사용하며, 총 개수는 맵 값의 합으로 도출된다.
- 특징 정렬 및 회귀 정확도 향상을 위해 L1 손실과 SSIM 손실의 조합을 사용해 학습한다.
실험 결과
연구 질문
- RQ1하나의 지원 예제만으로도 one-shot 객체 수세기에서 새로운 객체 카테고리에 대해 정확하고 강건한 수세기를 가능하게 할 수 있는가?
- RQ2어떻게 어텐션 메커니즘이 다양한 척도와 자세를 가진 다양한 객체 인스턴스 간 특징 상관관계 학습을 향상시킬 수 있는가?
- RQ3다중 척도 특징 융합이 소수 샘플 수세기에서 모델의 일반화 능력을 어느 정도 향상시키는가?
- RQ4제안된 LaoNet은 기존의 소수 샘플 수세기 모델 대비 더 빠른 수렴 속도와 더 높은 안정성을 확보하는가?
- RQ5한정된 카테고리에 대해 미세조정된 사전 학습된 객체 검출기조차도 one-shot 수세기 모델이 승리할 수 있는가?
주요 결과
- LaoNet은 FSC-147 데이터셋에서 최신 기술 수준의 성능을 달성하여, 기존 방법 대비 테스트 세트에서 MAE를 17.11에서 15.78로 감소시키고 RMSE를 56.81에서 97.15로 개선했다.
- COCO 데이터셋에서 LaoNet은 FSC147-COCO 테스트 분할에서 MAE 12.89와 RMSE 26.64를 기록했으며, RetinaNet 및 Faster R-CNN과 같은 사전 학습된 객체 검출기들보다 뚜렷이 뛰어난 성능을 보였다.
- 제거 실험 결과, Self-Attention 모듈이 성능 향상에 가장 기여하며, 제거된 버전 대비 MAE를 19.9% 감소시키고 RMSE를 13.1% 감소시켰다.
- Scale Aggregation 기법은 강건성을 향상시키며, 특히 이 기법이 없는 제거된 버전 대비 RMSE를 10.4% 감소시켰다.
- SSIM 손실은 성능을 추가로 향상시키며, 기준 모델 대비 MAE와 RMSE를 각각 1.5%와 3.4% 감소시켰다.
- LaoNet은 기준 방법들보다 뚜렷이 더 빠른 수렴 속도를 보였으며, 단지 2 에포크 만에 낮은 검증 MAE를 달성했고, FamNet은 유사한 성능에 도달하기 위해 40 에포크가 소요되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.