Skip to main content
QUICK REVIEW

[论文解读] MixerGAN: An MLP-Based Architecture for Unpaired Image-to-Image Translation

George Cazenavette, Manuel Ladrón de Guevara|arXiv (Cornell University)|May 28, 2021
Multimodal Machine Learning Applications参考文献 32被引用 10
一句话总结

MixerGAN 提出了一种新颖的基于 MLP 的生成模型,用于无配对图像到图像翻译,通过使用内存高效的 MLP-Mixer 架构替代注意力机制,以捕捉长距离像素依赖关系。该方法在性能上与卷积神经网络 GAN(如 CycleGAN)相当,同时显著降低了计算成本。

ABSTRACT

While attention-based transformer networks achieve unparalleled success in nearly all language tasks, the large number of tokens (pixels) found in images coupled with the quadratic activation memory usage makes them prohibitive for problems in computer vision. As such, while language-to-language translation has been revolutionized by the transformer model, convolutional networks remain the de facto solution for image-to-image translation. The recently proposed MLP-Mixer architecture alleviates some of the computational issues associated with attention-based networks while still retaining the long-range connections that make transformer models desirable. Leveraging this memory-efficient alternative to self-attention, we propose a new exploratory model in unpaired image-to-image translation called MixerGAN: a simpler MLP-based architecture that considers long-distance relationships between pixels without the need for expensive attention mechanisms. Quantitative and qualitative analysis shows that MixerGAN achieves competitive results when compared to prior convolutional-based methods.

研究动机与目标

  • 探索使用 MLP-Mixer(一种非卷积、非注意力架构)在生成式图像到图像翻译任务中的可行性。
  • 通过利用 MLP-Mixer 的高效长距离建模能力,解决视觉任务中自注意力机制带来的高内存消耗问题。
  • 建立一个新的无配对图像翻译基线,其结构更简单且参数效率高于现有的卷积神经网络 GAN。
  • 评估基于 MLP 的模型是否能在不依赖注意力或卷积归纳偏置的情况下,有效建模图像中的长距离依赖关系。

提出的方法

  • 生成器使用线性块投影将输入图像块转换为可学习向量,降低空间分辨率的同时保留特征表示。
  • 核心翻译过程通过堆叠的“混合块”实现,该块在通道维度和标记(token)维度上分别应用 MLP,以建模块间长距离依赖关系。
  • 模型采用与 CycleGAN 类似的生成器-判别器对抗训练方案,并引入循环一致性损失以强制实现可逆映射。
  • 生成器将潜在向量重新投影回图像块,并通过转置卷积或反卷积操作重建完整图像。
  • 混合块中使用参数共享的 MLP 以减少参数量并提高训练稳定性。
  • 模型通过对抗损失和循环一致性损失进行端到端训练,无需配对数据。

实验结果

研究问题

  • RQ1MLP-Mixer 架构是否能在不使用注意力或卷积归纳偏置的情况下,有效完成无配对图像到图像翻译?
  • RQ2在图像质量和多样性方面,基于 MLP 的生成器与 SOTA 卷积神经网络 GAN(如 CycleGAN)相比表现如何?
  • RQ3MLP-Mixer 在图像生成中的主要失败模式是什么,特别是与块投影过程中的信息丢失相关的问题?
  • RQ4MLP-Mixer 的内存效率是否能使其在图像翻译任务中实现显著降低计算成本的同时,仍保持具有竞争力的性能,相比 Transformer?

主要发现

  • MixerGAN 在 Horse2Zebra 和 Apple2Orange 数据集上取得了具有竞争力的定性结果,无需配对数据即可生成真实且多样的翻译图像。
  • 在 Yosemite 数据集上,MixerGAN 生成的结果更加鲜艳且季节性准确,例如雪更白、色彩更饱和,而 CycleGAN 的结果则更显暗淡。
  • 生成图像中出现块状伪影,尤其在高对比度或纹理丰富的区域(如斑马条纹),表明块投影过程中的信息损失带来了局限性。
  • 将输入分辨率降低至 128×128 可提升 Horse2Zebra 任务的翻译质量,表明块级别分辨率和通道容量对性能至关重要。
  • 主要失败模式是重复出现的相同块状伪影,作者将其归因于块投影过程中的高阶压缩和潜在通道容量有限。
  • 增加块投影后潜在通道的数量可减少信息损失并缓解伪影问题,尽管由于计算限制,该假设尚未得到充分验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。