[논문 리뷰] Retrieval Augmented Classification for Long-Tail Visual Recognition
이 논문은 사전에 인코딩된 이미지와 텍스트의 외부 메모리와 통합된 검색 모듈을 통합함으로써 표준 이미지 분류 성능을 햖थन하는 Retrieval Augmented Classification (RAC)을 제안한다. RAC는 검색 브랜치가 꼬리 클래스 표현을 암묵적으로 학습함으로써 기본 인코더가 미세조정 없이 헤드 클래스에 집중할 수 있도록 함으로써, 장꼬리 벤치마크에서 최신 기술 수준 성능을 달성한다—Places365-LT와 iNaturalist-2018에서 각각 14.5% 및 6.7%의 상대적 향상률을 기록한다.
We introduce Retrieval Augmented Classification (RAC), a generic approach to augmenting standard image classification pipelines with an explicit retrieval module. RAC consists of a standard base image encoder fused with a parallel retrieval branch that queries a non-parametric external memory of pre-encoded images and associated text snippets. We apply RAC to the problem of long-tail classification and demonstrate a significant improvement over previous state-of-the-art on Places365-LT and iNaturalist-2018 (14.5% and 6.7% respectively), despite using only the training datasets themselves as the external information source. We demonstrate that RAC's retrieval module, without prompting, learns a high level of accuracy on tail classes. This, in turn, frees the base encoder to focus on common classes, and improve its performance thereon. RAC represents an alternative approach to utilizing large, pretrained models without requiring fine-tuning, as well as a first step towards more effectively making use of external memory within common computer vision architectures.
연구 동기 및 목표
- 희귀 클래스에 대한 훈련 데이터가 부족하고 빈번한 클래스에 의해 가려지는 장꼬리 시각 인식 문제를 해결하기 위해.
- 비모수적 외부 메모리의 명시적 저장을 통해 파rameter가 많은 모델에 대한 의존도를 줄이기 위해.
- 기본 모델의 미세조정 없이 꼬리 클래스의 분류 성능을 향상시키기 위해.
- 검색 기반 보정이 기존의 일致성 기반 또는 앙상블 기반 접근 방식보다 장꼬리 학습에서 더 나은 성능을 낼 수 있는지 탐색하기 위해.
제안 방법
- RAC는 표준 기반 이미지 인코더와 병렬로 작동하는 검색 브랜치를 통합하며, 사전에 인코딩된 이미지와 관련된 텍스트 조각으로 구성된 비모수적 외부 메모리를 쿼리한다.
- 검색 모듈은 고정된 사전 훈련된 이미지 인코더(예: ViT)를 사용하여 이미지를 임bedding하고, 텍스트 인코더(예: BERT 유사)를 사용하여 관련 텍스트를 인코딩함으로써 다중모달 검색을 가능하게 한다.
- 추론 시기, 검색 모듈의 로그릿과 기반 인코더의 로그릿이 조합되어 최종 예측을 도출한다.
- 훈련 및 추론 중에 대규모 색인을 기반으로 약한 k-NN 검색(HNSW를 통해)을 사용하여 관련된 이미지-텍스트 쌍을 효율적으로 검색한다.
- 외부 메모리는 자체 훈련 데이터셋에서 생성되며, 이미지와 레이블 또는 캡션을 포함하므로 외부 데이터 소스가 필요하지 않다.
- 기본 인코더와 검색 브랜치의 공동 훈련은 수정된 LACE 손실을 사용하여 수행되며, 검색 구성 요소의 미세조정 없이도 엔드 투 엔드 최적화가 가능하다.
실험 결과
연구 질문
- RQ1미세조정 없이도 검색 기반 모듈이 장꼬리 시각 인식 벤치마크에서 분류 성능을 효과적으로 향상시킬 수 있는가?
- RQ2명시적인 유도 없이도 검색 모듈이 자연스럽게 꼬리 클래스에 집중하는 것을 학습할 수 있는가?
- RQ3외부 메모리 색인의 크기와 분류 정도에 따라 RAC의 성능은 어떻게 변화하는가?
- RQ4RAC는 손실 재가중 또는 로그릿 조정에 의존하는 기존 최신 기술 수준의 방법들을 능가할 수 있는가?
- RQ5표준 분류 파이프라인에 검색 기능을 통합할 경우 계산 오버헤드는 얼마나 되는가?
주요 결과
- RAC는 Places365-LT 벤치마크에서 14.5%의 상대적 향상률을 기록했고, iNaturalist-2018에서는 6.7%의 상대적 향상률을 기록하여 이전 최신 기술 수준의 방법들을 초월한다.
- 검색 모듈은 명시적인 유도 없이도 꼬리 클래스에 집중하는 것을 학습하며, 기반 인코더의 부담을 크게 줄인다.
- 성능 향상은 레이블의 세분성에 가장 민감하며, 기존 레이블에 샘플 수를 늘리는 것보다 고유한 레이블을 추가할 경우 더 큰 성과 향상을 얻는다.
- 검색 모듈의 영향으로 훈련 시간은 1.5~2배로 증가하지만, 대부분의 오버헤드는 색인 검색이 아닌 텍스트 인코더에서 기인한다.
- 색인 크기가 일정 수준을 넘어서면 수익 감소 현상이 나타나며, 대부분의 클래스가 표현된 이후 레이블의 정보량이 포화 상태에 이르게 된다.
- 색인 크기가 커져도 효율성을 유지하며, 1000만 개 이상의 색인은 단일 노드에서 8개의 A100 GPU를 사용해 실시간으로 검색 가능하며, 훈련 오버헤드도 극히 적다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.