[논문 리뷰] Images Speak in Images: A Generalist Painter for In-Context Visual Learning
이 논문은 입력과 출력을 모두 이미지로 간주하고, 연결된 입력-출력 이미지 쌍에 대해 마스킹된 이미지 모델링을 사용함으로써, 문맥 내 시각적 학습을 가능하게 하는 일반화된 시각 모델 Painter을 소개한다. 이 모델은 작업별 아키텍처나 손실 함수 수정 없이도 깊이 추정에서 최상의 성능을 기록하고, 세분화 및 이미지 복원을 포함한 일곱 가지 다양한 시각 작업에서 경쟁력 있는 결과를 내놓는다.
In-context learning, as a new paradigm in NLP, allows the model to rapidly adapt to various tasks with only a handful of prompts and examples. But in computer vision, the difficulties for in-context learning lie in that tasks vary significantly in the output representations, thus it is unclear how to define the general-purpose task prompts that the vision model can understand and transfer to out-of-domain tasks. In this work, we present Painter, a generalist model which addresses these obstacles with an "image"-centric solution, that is, to redefine the output of core vision tasks as images, and specify task prompts as also images. With this idea, our training process is extremely simple, which performs standard masked image modeling on the stitch of input and output image pairs. This makes the model capable of performing tasks conditioned on visible image patches. Thus, during inference, we can adopt a pair of input and output images from the same task as the input condition, to indicate which task to perform. Without bells and whistles, our generalist Painter can achieve competitive performance compared to well-established task-specific models, on seven representative vision tasks ranging from high-level visual understanding to low-level image processing. In addition, Painter significantly outperforms recent generalist models on several challenging tasks.
연구 동기 및 목표
- 작업 출력의 표현 방식이 크게 달라져 일반화가 어려운 컴퓨터 비전 분야에서의 문맥 내 학습 도전 과제를 해결한다.
- 자연어 처리(NLP)에서 텍스트 토큰이 공통 인터페이스로 기능하듯, 시각 작업에 대한 통합적이고 일반적인 인터페이스의 부재를 해결한다.
- 시각 작업의 출력을 3채널 이미지로 재정의하고, 이미지 쌍을 문맥 내 학습을 위한 프롬프트로 사용함으로써, 시각 중심의 솔루션을 제안한다.
- 언어 이해이나 모델 미세조정 없이도, 오직 시각적 맥락만으로도 영역 외 작업에 대해 제로샷 및 희소샷 적응을 가능하게 한다.
- 단일 통합 학습 목표를 사용하여 고수준 이해에서 저수준 복원에 이르기까지 다양한 시각 작업에서 경쟁 가능한 성능을 달성한다.
제안 방법
- 모든 시각 작업을 출력을 3채널 텐서(즉, '출력 이미지')로 표현함으로써 이미지 보정 문제로 재정의한다.
- 동일한 작업의 입력-출력 이미지 쌍을 연결하여 더 긴 하나의 이미지로 구성함으로써 학습 데이터를 구축한다.
- 출력 이미지 부분에 표준 마스킹된 이미지 모델링(MIM)을 적용하며, 예측을 입력 이미지 패치에 조건화한다.
- 추론 시에는 동일 작업의 입력-출력 이미지 쌍을 프롬프트로 사용하여, 명시적인 언어 지시 없이도 모델이 작업을 인fer할 수 있도록 한다.
- 아키텍처나 손실 함수의 변경 없이도 새로운 작업에 대해 단일 일반화 모델을 종합적으로 끝에서 끝까지 학습한다.
- 입력-출력 예제 쌍을 직접 맥락으로 제공함으로써 문맥 내 추론을 가능하게 하여, 모델이 알려지지 않은 카테고리와 작업으로 일반화할 수 있도록 한다.

실험 결과
연구 질문
- RQ1언어 토큰에 의존하지 않고도, 문맥 내 학습을 가능하게 하는 공통 인터페이스로 모든 시각 작업을 통합할 수 있는가?
- RQ2다양한 작업을 수행할 수 있도록 단일이고 단순한 목표를 사용해 일반화된 시각 모델을 훈련할 수 있으며, 강력한 성능을 유지할 수 있는가?
- RQ3모델이 언어 감독이나 미세조정 없이도, 오직 시각적 예시만으로 영역 외 작업에 일반화할 수 있는가?
- RQ4출력을 이미지로 간주하고 이미지 쌍을 프롬프트로 사용할 경우, 기존의 일반화 모델 대비 더 나은 희소샷 및 제로샷 일반화 성능을 내는가?
- RQ5통합된 이미지 중심 프레임워크가 깊이 추정 및 포안옵티컬 세그멘테이션과 같은 도전적인 작업에서 전용 모델을 능가할 수 있는가?
주요 결과
- Painter는 NYUv2 깊이 추정에서 이전의 전용 모델보다 뛰어난 최상의 성능을 기록하며, 복잡한 아키텍처와 손실 함수를 사용한 경우를 초월한다.
- 세분화(ADE-20K), 인스턴스 및 파노프틱 세그멘테이션(COCO), 관건점 검출에서 경쟁적인 성능을 내며, 작업별 전용 모델과 동등하거나 이를 초월한다.
- 이미지 노이즈 제거, 비 오름, 저조도 강화와 같은 도전적인 작업에서 최근의 일반화 모델보다 뚜렷이 뛰어난 성능을 보인다.
- 훈련 데이터에 포함되지 않은 영역 외 카테고리, 예를 들어 개방형 어휘 관건점 검출(예: 말, 원숭이, 빗자루) 및 인스턴스 세그멘테이션(예: 태블릿)에 대해 효과적으로 일반화된다.
- 검색된 또는 학습된 프롬프트를 통한 프롬프트 튜닝은 무작위 프롬프트보다 성능을 향상시키며, 프롬프트 최적화가 문맥 내 학습 능력을 향상시킨다는 것을 보여준다.
- 무작위 프롬프트조차도 모델이 강력한 내재적 안정성과 일반화 능력을 보이며, 이미지 중심의 문맥 내 학습 프레임워크의 우수함을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.