[论文解读] S2WAT: Image Style Transfer via Hierarchical Vision Transformer using Strips Window Attention
S2WAT 提出了一种用于图像风格迁移的分层视觉变换器,采用条带窗口注意力(SpW Attention)以平衡局部与全局特征建模,并通过动态的'Attn Merge'机制整合多种窗口形状。该方法在基准数据集上实现了最先进性能,内容泄漏显著减少,且风格化质量更优。
Transformer's recent integration into style transfer leverages its proficiency in establishing long-range dependencies, albeit at the expense of attenuated local modeling. This paper introduces Strips Window Attention Transformer (S2WAT), a novel hierarchical vision transformer designed for style transfer. S2WAT employs attention computation in diverse window shapes to capture both short- and long-range dependencies. The merged dependencies utilize the "Attn Merge" strategy, which adaptively determines spatial weights based on their relevance to the target. Extensive experiments on representative datasets show the proposed method's effectiveness compared to state-of-the-art (SOTA) transformer-based and other approaches. The code and pre-trained models are available at https://github.com/AlienZhang1996/S2WAT.
研究动机与目标
- 为解决基于变换器的风格迁移中的局部性问题,即基于窗口的注意力导致的网格状伪影和局部建模能力弱化。
- 改善风格迁移网络中短距离(局部)与长距离(全局)特征建模之间的平衡。
- 在迭代式风格迁移过程中减少内容泄漏,尤其是在重复应用同一风格时。
- 开发一种动态融合机制,根据对目标的相关性自适应加权来自不同窗口形状的注意力输出。
提出的方法
- 提出条带窗口注意力(SpW Attention),通过水平条带、垂直条带和方形窗口三种窗口类型计算自注意力,以捕捉长距离与短距离依赖关系。
- 采用新颖的'Attn Merge'策略,通过计算输入特征与注意力输出之间的空间相关性得分,动态分配融合权重。
- 使用分层变换器架构,结合图像块嵌入与多尺度特征提取,实现在多个感受野上的高效建模。
- 在编码器模块中应用SpW Attention机制,以在有效传递艺术风格的同时保留内容细节。
- 利用多头自注意力结合相对位置偏置,以在特征变换过程中保持空间结构。
- 采用感知损失与风格损失进行端到端训练,且通过自适应的Attn Merge机制稳定优化过程。
实验结果
研究问题
- RQ1具有多形状窗口注意力的分层视觉变换器是否能同时改善图像风格迁移中的局部与全局特征建模?
- RQ2所提出的'Attn Merge'机制是否在注意力输出融合方面优于静态融合策略(如拼接或求和)?
- RQ3S2WAT在迭代式风格迁移中缓解内容泄漏方面与最先进方法相比表现如何?
- RQ4与标准方形窗口相比,使用条带形窗口在多大程度上减少了网格状伪影?
- RQ5在用户研究中,该模型在多样化内容与风格组合下的泛化能力如何?
主要发现
- 在大规模用户研究中,S2WAT以25.4%的得票率在感知风格化质量方面优于StyTr2(23.6%)、ArtFlow(13.3%)、MCC(19.4%)和SANet(18.3%)。
- 与求和和拼接融合策略相比,'Attn Merge'机制显著更优,其中基于求和的输出严重受损,而拼接方式则丢失了关键风格信息。
- S2WAT在20轮迭代式风格迁移中表现出极低的内容细节损失,优于遭受模糊化与退化问题的CNN-based和SDM-based模型。
- 可视化消融实验表明,仅使用水平或垂直条带窗口会产生方向性伪影,而通过Attn Merge融合两者则可获得无伪影、高质量的结果。
- 该模型有效缓解了内容泄漏问题,即使在重复应用风格时,生成结果仍能保留精细的内容细节。
- 在公开数据集上的广泛实验验证了S2WAT在定量指标与定性评估中均达到最先进水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。