[논문 리뷰] LipsFormer: Introducing Lipschitz Continuity to Vision Transformers
LipsFormer는 LayerNorm를 CenterNorm로, 내적 연산을 스케일링된 코사인 유사도 연산으로, 잔차 연결을 가중치가 있는 변형으로, Xavier 초기화를 스펙트럼 초기화로 대체하여 안정적인 구성 요소를 갖춘 Lipschitz 연속적인 비전 트랜스포머 아키텍처를 제안한다. 이 설계는 학습률 웜업 없이도 안정적인 훈련을 가능하게 하며, Swin-Tiny를 사용해 300 에포크 동안 ImageNet-1K에서 82.7%의 상위-1 정확도를 달성하고, CSwin-Tiny를 사용해 83.5%의 정확도를 달성한다.
We present a Lipschitz continuous Transformer, called LipsFormer, to pursue training stability both theoretically and empirically for Transformer-based models. In contrast to previous practical tricks that address training instability by learning rate warmup, layer normalization, attention formulation, and weight initialization, we show that Lipschitz continuity is a more essential property to ensure training stability. In LipsFormer, we replace unstable Transformer component modules with Lipschitz continuous counterparts: CenterNorm instead of LayerNorm, spectral initialization instead of Xavier initialization, scaled cosine similarity attention instead of dot-product attention, and weighted residual shortcut. We prove that these introduced modules are Lipschitz continuous and derive an upper bound on the Lipschitz constant of LipsFormer. Our experiments show that LipsFormer allows stable training of deep Transformer architectures without the need of careful learning rate tuning such as warmup, yielding a faster convergence and better generalization. As a result, on the ImageNet 1K dataset, LipsFormer-Swin-Tiny based on Swin Transformer training for 300 epochs can obtain 82.7\% without any learning rate warmup. Moreover, LipsFormer-CSwin-Tiny, based on CSwin, training for 300 epochs achieves a top-1 accuracy of 83.5\% with 4.7G FLOPs and 24M parameters. The code will be released at \url{https://github.com/IDEA-Research/LipsFormer}.
연구 동기 및 목표
- 초기화 시에 지속적인 훈련 불안정성 문제를 해결한다.
- 학습률 웜업이나 정규화와 같은 일반적인 기법보다 Lipschitz 연속성이 더 근본적인 성질임을 규명한다.
- 정규화, 어텐션, 잔차 연결, 가중치 초기화 등의 핵심 구성 요소에 걸쳐 Lipschitz 연속성을 강제하는 통합적 프레임워크를 개발한다.
- 안정적인 네트워크 설계를 안내하기 위해 Lipschitz 상수에 대한 이론적 상한을 도출한다.
- LipsFormer가 학습률 웜업에 대한 초모수 튜닝 없이도 안정적이고 종단 간 훈련이 가능함을 입증한다.
제안 방법
- LayerNorm를 특징을 중심화하지만 스케일링을 하지 않는 Lipschitz 연속 정규화 레이어인 CenterNorm로 대체한다.
- 적절한 스케일링 하에 Lipschitz 연속성이 입증된 스케일링된 코사인 유사도 어텐션으로 내적 연산을 대체한다.
- 학습 가능한, 0으로 초기화된 게이트를 갖춘 가중치가 있는 잔차 연결을 도입하여 잔차 업데이트의 안정성을 높인다.
- Xavier 초기화 대신 스펙트럼 기반 가중치 초기화를 적용하여 초기화 단계에서 유한한 스펙트럼 노름을 보장한다.
- Lipschitz 함수의 조합 규칙을 사용하여 전체 LipsFormer 아키텍처의 Lipschitz 상수에 대한 이론적 상한을 유도한다.
- Swin 및 CSwin 트랜스포머의 표준 구성 요소들을 그들의 Lipschitz 연속성 버전으로 대체하여 LipsFormer-Swin 및 LipsFormer-CSwin을 구성한다.

실험 결과
연구 질문
- RQ1핵심 트랜스포머 구성 요소들에 대해 Lipschitz 연속성을 강제하면 학습률 웜업 없이도 더 안정적인 훈련이 가능할 수 있는가?
- RQ2트랜스포머 네트워크의 이론적 Lipschitz 상수가 실질적인 훈련 가능성과 일반화 능력과 어떻게 관련이 있는가?
- RQ3기본 트랜스포머 아키텍처에서 Lipschitz 연속성을 위반하고 훈련 불안정성에 기여하는 특정 구성 요소는 무엇인가?
- RQ4통합적인 Lipschitz 설계가 DeepNorm이나 ReZero와 같은 점진적 개선 기법보다 훈련 안정성과 수렴성에서 뛰어나게 성능을 높일 수 있는가?
- RQ5Lipschitz 연속성 트랜스포머는 초모수 튜닝 없이도 ImageNet-1K와 같은 표준 벤치마크에서 성능을 유지하거나 향상시킬 수 있는가?
주요 결과
- LipsFormer는 학습률 웜업 없이도 300 에포크 동안 Swin-Tiny를 사용해 ImageNet-1K에서 82.7%의 상위-1 정확도를 달성한다.
- LipsFormer-CSwin-Tiny는 오직 4.7G FLOPs와 24M 파라미터로도 학습률 웜업 없이 83.5%의 상위-1 정확도를 달성한다.
- LipsFormer의 Lipschitz 상수에 대한 이론적 상한이 유도되었으며, 초기화 단계에서 유한함을 입증하여 원칙적인 안정성 보장을 제공한다.
- 실험 결과는 웜업 없이도 네트워크가 안정적으로 유지되고 더 빠르게 수렴함을 확인하여 Lipschitz 연속성의 가정이 타당함을 검증한다.
- 제안된 구성 요소들인 CenterNorm, 스케일링된 코사인 어텐션, 가중치가 있는 잔차 연결, 스펙트럼 초기화는 기존의 비전 트랜스포머 아키텍처에 즉시 대체 적용할 수 있다.
- LipsFormer는 특히 깊은 아키텍처에서 초모수 튜닝 없이도 표준 Swin 및 CSwin 기반 모델보다 훈련 안정성과 일반화 능력에서 뛰어나다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.