[논문 리뷰] S2WAT: Image Style Transfer via Hierarchical Vision Transformer using Strips Window Attention
S2WAT는 지역 및 전역 특징 모델링을 균형 있게 유지하기 위해 스트립 윈도우 어텐션(SpW Attention)을 사용하는 계층적 비전 트랜스포머를 제안한다. 다양한 윈도우 형태를 동적 'Attn Merge' 메커니즘을 통해 통합함으로써, 벤치마크 데이터셋에서 콘텐츠 누출을 감소시키고 우수한 스타일 전이 품질을 달성한다.
Transformer's recent integration into style transfer leverages its proficiency in establishing long-range dependencies, albeit at the expense of attenuated local modeling. This paper introduces Strips Window Attention Transformer (S2WAT), a novel hierarchical vision transformer designed for style transfer. S2WAT employs attention computation in diverse window shapes to capture both short- and long-range dependencies. The merged dependencies utilize the "Attn Merge" strategy, which adaptively determines spatial weights based on their relevance to the target. Extensive experiments on representative datasets show the proposed method's effectiveness compared to state-of-the-art (SOTA) transformer-based and other approaches. The code and pre-trained models are available at https://github.com/AlienZhang1996/S2WAT.
연구 동기 및 목표
- 윈도우 기반 어텐션으로 인해 발생하는 격자 무늬 아티팩트와 약한 지역 모델링 문제를 해결하기 위해 트랜스포머 기반 스타일 전이의 국소성 문제를 해결한다.
- 스타일 전이 네트워크에서 단기(지역) 및 장기(전역) 특징 모델링 간의 균형을 향상시킨다.
- 특히 동일한 스타일을 반복 적용할 경우에 발생하는 콘텐츠 누출을 줄인다.
- 목표에 맞는 관련성을 기반으로 다양한 윈도우 형태에서 유도된 어텐션 출력을 적응적으로 가중하는 동적 융합 메커니즘을 개발한다.
제안 방법
- 수평 스트립, 수직 스트립, 정사각형 윈도우의 세 가지 윈도우 유형을 활용해 자기 어텐션을 계산하는 스트립 윈도우 어텐션(SpW Attention)을 도입하여 장거리 및 단거리 의존성을 모두 포착한다.
- 입력 특징와 어텐션 출력 간의 공간 상관관계 점수를 계산하여 융합 가중치를 동적으로 할당하는 새로운 'Attn Merge' 전략을 적용한다.
- 패치 임bedding과 다중 해상도 특징 추출을 통한 계층적 트랜스포머 아키텍처를 사용하여 다양한 수신장 내에서 효율적인 모델링을 가능하게 한다.
- 콘텐츠 세부 정보를 유지하면서 예술적 스타일을 효과적으로 전달하기 위해 인코더 블록에 SpW Attention 메커니즘을 적용한다.
- 상대적 위치 편향을 사용한 멀티헤드 자기 어텐션을 활용하여 특징 변환 과정에서 공간적 구조를 유지한다.
- 퍼셉추얼 손실과 스타일 손실을 사용하여 엔드 투 엔드로 모델을 훈련시키며, 적응적인 Attn Merge 메커니즘이 최적화를 안정화시킨다.
실험 결과
연구 질문
- RQ1다양한 형태의 윈도우 어텐션을 갖춘 계층적 비전 트랜스포머가 이미지 스타일 전이에서 지역 및 전역 특징 모델링을 동시에 향상시킬 수 있는가?
- RQ2제안된 'Attn Merge' 메커니즘이 연결 또는 합산과 같은 정적 융합 전략보다 어텐션 출력 통합에서 우월한 성능을 보일 수 있는가?
- RQ3반복적인 스타일 전이 과정에서 S2WAT는 콘텐츠 누출을 SOTA 기법들보다 효과적으로 줄일 수 있는가?
- RQ4기존의 정사각형 윈도우에 비해 스트립형 윈도우의 사용이 격자 무늬 아티팩트를 얼마나 감소시키는가?
- RQ5사용자 연구에서 다양한 콘텐츠와 스타일 조합에 대해 모델이 잘 일반화되는가?
주요 결과
- 대규모 사용자 연구에서 S2WAT는 25.4%의 득표율을 기록하여, StyTr2(23.6%), ArtFlow(13.3%), MCC(19.4%), SANet(18.3%)를 압도적으로 앞서는 인식된 스타일 전이 품질을 확보했다.
- 'Attn Merge' 메커니즘이 합산 및 연결 융합 전략보다 뚜렷하게 뛰어난 성능을 보였으며, 합산 기반 출력은 심각한 손상이 발생했고, 연결 융합은 핵심 스타일 정보를 손실했다.
- 20회의 반복적 스타일 전이 과정 동안 S2WAT는 콘텐츠 세부 정보 손실가 최소화되었으며, 블러링과 열화 현상이 발생하는 CNN 기반 및 SDM 기반 모델들을 능가했다.
- 시각적 아블레이션 결과, 수평 또는 수직 스트립 윈도우만 사용할 경우 방향성 아티팩트가 발생하지만, Attn Merge를 통해 융합하면 아티팩트 없이 고품질 결과를 얻을 수 있었다.
- 모델는 콘텐츠 누출을 효과적으로 완화했으며, 반복적인 스타일 전이 조건에서도 세밀한 콘텐츠 세부 정보를 유지하는 데 성공했다.
- 공개 데이터셋에서의 광범위한 실험을 통해 S2WAT는 정량적 지표와 정성적 평가 모두에서 최신 기술(SOTA) 수준의 성능을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.