[논문 리뷰] Fine-tuning Image Transformers using Learnable Memory
이 논문은 뷰어션 트랜스포머에 학습 가능한 메모리 토큰—각 레이어에 삽입되는 추가적인 학습 가능한 임bedding—을 도입하여, 하류 작업에 대해 효율적이고 파rameter 효율적인 미세조정을 가능하게 한다. 주의 마스크를 사용함으로써, 기존 작업의 성능을 유지하면서도 새로운 작업으로의 확장을 가능하게 하며, 정확도 저하를 최소화하여 전체 미세조정 수준에 가까운 성능를 달성하면서도 레이어당 몇 개의 추가 파라미터만 사용한다.
In this paper we propose augmenting Vision Transformer models with learnable memory tokens. Our approach allows the model to adapt to new tasks, using few parameters, while optionally preserving its capabilities on previously learned tasks. At each layer we introduce a set of learnable embedding vectors that provide contextual information useful for specific datasets. We call these "memory tokens". We show that augmenting a model with just a handful of such tokens per layer significantly improves accuracy when compared to conventional head-only fine-tuning, and performs only slightly below the significantly more expensive full fine-tuning. We then propose an attention-masking approach that enables extension to new downstream tasks, with a computation reuse. In this setup in addition to being parameters efficient, models can execute both old and new tasks as a part of single inference at a small incremental cost.
연구 동기 및 목표
- 시각 트랜스포머에서 전체 미세조정의 높은 비용과 불안정성 문제를 해결하기 위해, 특히 연속 학습 시나리오에서의 문제를 해결한다.
- 최소한의 파라미터 업데이트로 새로운 하류 작업에 효율적으로 적응할 수 있도록 한다.
- 모델을 새로운 작업으로 확장할 때 이전에 학습한 작업의 높은 성능를 유지한다.
- 단일 모델 내에서 여러 작업 간의 계산 재사용과 공동 추론을 가능하게 한다.
- 시각 트랜스포머에서의 수명 주기 학습을 위한 파라미터 효율적이고 확장 가능하며 안정적인 방법을 탐색한다.
제안 방법
- 각 ViT 인코더 레이어에 소량의 학습 가능한 메모리 토큰을 추가하여, 주의 계산 이전에 입력 시퀀스에 붙인다.
- 기존 토큰에 주의를 하지 않으며, 클래스 토큰과 패치 토큰만 레이어 간에 업데이트되는 수정된 주의 메커니즘을 사용한다.
- 기존 작업 토큰이 새로 추가된 메모리 토큰과 클래스 토큰에 주의를 하지 못하도록 제한하는 주의 마스크 전략을 도입하여, 추론 중 간섭을 방지한다.
- 새로운 작업에 대해 순차적으로 모델을 훈련함으로써, 기존 주의 제약 조건을 유지하면서도 입력 시퀀스에 새로운 작업 전용 메모리 토큰과 클래스 토큰을 추가한다.
- 주의 마스크를 사용하여 독립적으로 훈련된 모델들을 연결함으로써 모델 확장을 허용하며, 증분적인 계산 비용으로 공동 추론을 가능하게 한다.
- 모든 작업에 공통된 백본을 사용하고, 작업 전용 메모리와 분류 헤드를 사용함으로써 파라미터 공유와 효율적인 추론을 가능하게 한다.
실험 결과
연구 질문
- RQ1학습 가능한 메모리 토큰은 최소한의 파라미터 업데이트로 시각 트랜스포머의 미세조정 정확도를 크게 향상시킬 수 있는가?
- RQ2주의 마스크는 모델을 새로운 작업으로 확장할 때 이전에 학습한 작업의 성능 저하를 방지할 수 있는가?
- RQ3메모리 보강된 미세조정의 성능는 헤드 전용 및 전체 미세조정과 비교해 어떻게 되는가?
- RQ4다양한 작업에서 훈련된 여러 모델을 최소한의 정확도 손실과 증분적인 계산 비용으로 하나의 모델로 통합할 수 있는가?
- RQ5레이어당 메모리 토큰의 수가 모델 성능에 영향을 주는가? 그리고 포화점이 존재하는가?
주요 결과
- 레이어당 몇 개의 메모리 토큰만 추가해도 헤드 전용 미세조정보다 정확도가 크게 향상되어 전체 미세조정 수준에 가까운 성능를 달성한다.
- 주의 마스크를 사용함으로써, 여러 작업에 순차적으로 훈련된 모델들은 이전 작업의 정확도를 높이 유지하며, 순차적 연결에서 관찰되는 20%-40%의 정확도 저하를 피할 수 있다.
- SUN-397에서 시작하여 Places-365로, 또는 그 반대로 순차적으로 작업을 추가한 모델은 성능 저하 없이 안정적인 성능를 보였으며, 독립적으로 훈련하고 연결한 모델보다 뛰어난 성능를 보였다.
- 메모리 토큰이 있는 모델는 전체 미세조정에 필요한 파라미터의 일부분만 사용함에도 불구하고, 메모리가 없는 기준 모델보다 뛰어난 성능를 보였다.
- 레이어당 10개를 초과하는 메모리 토큰에서는 성능 향상이 둔화되어 수익 감소 현상이 나타나는 것으로 보이며, 이는 메모리 크기 증가에 따른 성능 향상의 한계를 시사한다.
- 주의 마스크 전략을 통해 효율적인 계산 재사용이 가능해져, 새로운 작업마다 소량의 증분 비용으로 모든 작업에 대한 공동 추론이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.