[논문 리뷰] VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
VisionLLaMA는 LLaMA 언어 모델을 영감으로 삼아 통합된 비전 트랜스포머 아키텍처를 도입하여 이미지 분류, 객체 검출, 세그멘테이션, 디퓨전 기반 생성 등 다양한 비전 작업에서 효율적이고 효과적인 성능을 달성한다. LLaMA의 트랜스포머 설계를 새로운 2D 순환 위치 인코딩(AS2DRoPE)으로 적응시킴으로써 아키텍처의 추가 기능 없이도 더 빠른 수렴과 최첨단 성능을 달성한다.
Large language models are built on top of a transformer-based architecture to process textual inputs. For example, the LLaMA stands out among many open-source implementations. Can the same transformer be used to process 2D images? In this paper, we answer this question by unveiling a LLaMA-like vision transformer in plain and pyramid forms, termed VisionLLaMA, which is tailored for this purpose. VisionLLaMA is a unified and generic modelling framework for solving most vision tasks. We extensively evaluate its effectiveness using typical pre-training paradigms in a good portion of downstream tasks of image perception and especially image generation. In many cases, VisionLLaMA have exhibited substantial gains over the previous state-of-the-art vision transformers. We believe that VisionLLaMA can serve as a strong new baseline model for vision generation and understanding. Our code is released at https://github.com/Meituan-AutoML/VisionLLaMA.
연구 동기 및 목표
- 비전 모델과 언어 모델 간의 아키텍처 격차를 해소하기 위해 LLaMA 트랜스포머 아키텍처를 2D 이미지 입력에 적응시키는 것.
- 단일 백본을 사용하여 다수의 비전 작업을 해결하기 위한 일반적이고 통합된 프레임워크를 개발하여 모odal별 설계 복잡성을 줄이는 것.
- LLaMA의 아키텍처적 강점인 RMSNorm, SwiGLU, RoPE를 활용하여 비전 작업의 학습 효율성과 성능을 향상시키는 것.
- 새로운 위치 인코딩 기반(AS2DRoPE)을 통해 다양한 이미지 해상도에서 제로샷 일반화를 가능하게 하는 것.
제안 방법
- LLaMA 유사 아키텍처를 가진 비전 트랜스포머인 VisionLLaMA를 제안하며, RMSNorm, SwiGLU, 순환 위치 임베딩(RoPE)을 포함하고 2D 이미지 데이터에 적응시킨다.
- 입력 해상도가 임의일 수 있도록 보간 스케일링을 통해 지원하는 학습 가능한 2D 순환 위치 인코딩인 AS2DRoPE(자동 스케일링 2D RoPE)를 도입한다.
- 다양한 비전 작업 파라다임(예: ViT 대비 Swin 트랜스포머 스타일)을 평가하기 위해 일반형 및 피라미드 기반 백본 설계를 모두 활용한다.
- ImageNet 및 LAION 데이터셋에서 감독 학습 및 자기지도 학습 전처리(예: MAE 및 대비 학습)를 위해 VisionLLaMA를 적용한다.
- 잠재 디퓨전과 CLIP 인코더를 사용하는 DiT 및 SiT 모델에 VisionLLaMA를 통합하여 텍스트 기반 이미지 생성에 활용한다.
- LLaMA 스타일 최적화를 사용하는 통합 학습 파이프라인을 적용: 자기지도 학습 전처리 후, RLHF 유사 적응을 통한 감독 미세조정
실험 결과
연구 질문
- RQ11D 대비 2D, 일반형 대비 피라미드 아키텍처의 차이가 있음에도 불구하고 LLaMA 트랜스포머 아키텍처가 2D 비전 작업에 효과적으로 적응될 수 있는가?
- RQ2AS2DRoPE는 표준 2D 사인-余현 위치 인코딩 및 NTK 기반 RoPE와 비교해 해상도 간 일반화 능력과 수렴 속도 측면에서 어떻게 성능을 내는가?
- RQ3VisionLLaMA는 ViT, DeiT, Swin 등 기존 비전 트랜스포머보다 감독 학습 및 자기지도 학습 설정에서 다양한 비전 작업 전반에서 성능을 뛰어나게 하는가?
- RQ4VisionLLaMA는 특히 해상도 품질과 학습 효율성 측면에서 디퓨전 기반 이미지 생성의 강력한 백본으로 기능할 수 있는가?
- RQ5기존 ViT에 비해 VisionLLaMA가 더 빠른 수렴과 향상된 성능를 보이는 이론적 및 실증적 근거는 무엇인가?
주요 결과
- 피라미드 소형 모델을 사용해 ImageNet-1K에서 81.6%의 정확도를 달성했으며, 동일한 학습 설정에서 ViT-Base와 DeiT3-Large를 모두 능가한다.
- DiT-LLaMA-XL에서 이미지 생성을 수행한 결과, 분류기 없는 가이던스(CFG) 비율 4.0로 고해상도 256×256 이미지를 생성하여 강력한 생성 능력을 입증했다.
- VisionLLaMA는 ViT 및 DeiT3-Large보다 더 빠른 수렴을 보였으며, 디퓨전 학습에서 SiT-LLaMA는 300k 스텝에서 ViT가 400k 스텝을 돌았을 때보다 더 높은 성능를 달성했다.
- AS2DRoPE 위치 인코딩을 통해 임의의 해상도에서 제로샷 평가가 가능했으며(예: 224×224, 384×384, 512×512), 미세조정 없이도 512×512 해상도에서 79.5%의 정확도를 기록했다.
- MAE 전처리 학습에서, VisionLLaMA는 800 에포크 동안 ViT-Base보다 낮은 학습 손실을 유지하여 더 안정적이고 효율적인 최적화를 보였다.
- 이론적 분석을 통해 VisionLLaMA의 RoPE 기반 어텐션 메커니즘이 추가 위치 인코딩 대비 콘텐츠-위치 상호작용을 감소시켜 더 빠르고 효과적인 학습을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.