Skip to main content
QUICK REVIEW

[논문 리뷰] Towards In-context Scene Understanding

Ivana Balažević, David Steiner|arXiv (Cornell University)|2023. 06. 02.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 근접한 이웃(NN) 검색을 통해 문맥 내 학습을 위한 특징 표현을 향상시키는 새로운 문맥적 사전학습 프로토콜로 사전학습된 비전 트랜스포머 모델인 Hummingbird를 소개한다. 교차 이미지 어텐션과 공간 어텐션 풀링을 활용하여, 미세조정 없이도 밀도 높은 장면 이해 작업(예: 세분화 및 깊이 추정)에서 최신 기술 수준의 제로샷 성능을 달성한다. 이는 작업별로 미세조정된 모델의 정확도에 가까이 도달하면서도 새로운 작업에 빠르고 데이터 효율적으로 적응할 수 있게 한다.

ABSTRACT

In-context learning$\unicode{x2013}$the ability to configure a model's behavior with different prompts$\unicode{x2013}$has revolutionized the field of natural language processing, alleviating the need for task-specific models and paving the way for generalist models capable of assisting with any query. Computer vision, in contrast, has largely stayed in the former regime: specialized decoders and finetuning protocols are generally required to perform dense tasks such as semantic segmentation and depth estimation. In this work we explore a simple mechanism for in-context learning of such scene understanding tasks: nearest neighbor retrieval from a prompt of annotated features. We propose a new pretraining protocol$\unicode{x2013}$leveraging attention within and across images$\unicode{x2013}$which yields representations particularly useful in this regime. The resulting Hummingbird model, suitably prompted, performs various scene understanding tasks without modification while approaching the performance of specialists that have been finetuned for each task. Moreover, Hummingbird can be configured to perform new tasks much more efficiently than finetuned models, raising the possibility of scene understanding in the interactive assistant regime.

연구 동기 및 목표

  • 기존에 작업별로 미세조정이 필요로 하는 밀도 높은 컴퓨터 비전 작업(예: 세분화 및 깊이 추정)을 위한 문맥 내 학습을 가능하게 하기 위해.
  • 비모수적 검색에 적합한 표현을 생성하는 사전학습 프로토콜을 개발하여, 파rameter 업데이트 없이도 빠른 적응을 가능하게 하기 위해.
  • 자기지도 학습 기반 비전 모델이 프롬프트 기반 검색만으로도 밀도 높은 장면 이해 작업에서 강력한 제로샷 성능를 달성할 수 있는지 조사하기 위해.
  • 다양한 사전학습 목표 및 아키텍처 구성 요소가 검색 기반 장면 이해를 얼마나 효과적으로 지원하는지 비교하기 위해.
  • 단일 일반화 모델이 프롬프트 엔지니어링을 통해 새로운 비전 작업에 효율적으로 적응할 수 있음을 보여주어 높은 비용이 드는 미세조정에 대한 의존도를 줄이기 위해.

제안 방법

  • 교차 이미지 어텐션을 통해 각 이미지의 공간적 특징을 다른 이미지의 특징 메모리 백업에서 업데이트하는 방식의 새로운 사전학습 프로토콜인 문맥 사전학습을 제안한다.
  • 하위 작업 검색을 위한 표현 품질을 향상시키기 위해, 문맥화된 특징 그리드를 단일 이미지 수준 표현으로 요약하는 공간 어텐션 풀링을 도입한다.
  • 검색 기반의 감독을 통한 대비적 자기지도 학습 목표를 사용하며, 모델은 애너테이션된 예제의 메모리 백업에서 정확한 특징을 검색하도록 학습한다.
  • 이중 메모리 메커니즘을 적용한다: 사전학습 중 자기지도 학습을 위한 메모리 백업과 추론 시 근접한 이웃 검색을 위한 평가 메모리 백업을 별도로 운영한다.
  • 모델 업데이트 없이도 추론 시에 인코더의 특징을 사용해 근접한 이웃 검색을 적용함으로써, 새로운 작업에 대해 제로샷 적응을 가능하게 한다.
  • ViT-B 및 ViT-L 인코더를 사용해 ImageNet-22k에서 모델을 훈련하며, 메모리 백업 크기, 샘플링 전략, 사전학습 목표에 대한 분석을 수행한다.
Figure 1: In-context scene understanding with nearest neighbor retrieval. On the left, we provide the system with a “prompt” of annotated images. On the right, we ask the system to describe new query images. The network computes dense features for each location and uses them to query features comput
Figure 1: In-context scene understanding with nearest neighbor retrieval. On the left, we provide the system with a “prompt” of annotated images. On the right, we ask the system to describe new query images. The network computes dense features for each location and uses them to query features comput

실험 결과

연구 질문

  • RQ1비전 트랜스포머는 세분화 및 깊이 추정과 같은 밀도 높은 장면 이해 작업을 위한 문맥 내 학습을 지원하도록 사전학습될 수 있는가?
  • RQ2교차 이미지 어텐션을 활용한 문맥 사전학습은 표준 자기지도 학습 사전학습보다 제로샷 검색 성능을 어떻게 향상시키는가?
  • RQ3공간 어텐션 풀링이 전역 풀링이나 [CLS] 토큰에 비해 검색 기반 장면 이해에 미치는 영향은 무엇인가?
  • RQ4사전학습 단계에서 검색 기반 감독이 하류 작업으로의 일반화 능력에 얼마나 기여하는가?
  • RQ5정확도, 데이터 효율성, 적응 속도 측면에서 검색 기반 추론 성능는 미세조정된 모델과 비교해 어떻게 되는가?

주요 결과

  • Hummingbird는 근접한 이웃 검색만을 사용해 PASCAL VOC 세분화에서 70.5% mIoU, ADE20K에서 30.7% mIoU를 달성하며, 완전히 미세조정된 모델의 성능에 근접한다.
  • ViT-L 및 ImageNet-22k 사전학습을 통해 Hummingbird는 PASCAL VOC에서 84.1% mIoU, ADE20K에서 50.8% mIoU를 기록하여 강력한 제로샷 일반화 능력을 입증한다.
  • 자기지도 학습과 검색 기반 목표를 모두 적용한 모델(Hummingbird++)은 ADE20K에서 76.2% mIoU를 기록하며, 순수 자기지도 학습 또는 검색 감독 기반 기준 모델을 모두 초월한다.
  • 근접한 이웃 검색은 미세조정보다 실행 간 변동성이 10배 적고, 하이퍼파ram터 서치가 필요 없어 신뢰할 수 있고 효율적인 온라인 평가 대체 수단이 된다.
  • 더 큰 사전학습 및 평가 메모리 백업(예: 153,600개의 특징)은 특히 ADE20K와 같은 더 큰 데이터셋에서 성능 향상에 크게 기여한다.
  • 제안된 문맥 사전학습과 공간 어텐션 풀링은 MAE나 DINO와 같은 표준 자기지도 학습 방법보다 검색에 훨씬 효과적인 표현을 생성한다.
Figure 2: Hummingbird model components.
Figure 2: Hummingbird model components.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.