[论文解读] Emojich -- zero-shot emoji generation using Russian language: a technical report
本文提出 Emojich,一种基于 ruDALL-E Malevich (XL) 微调的零样本文本到图像模型,可从文本描述生成风格化的俄语表情符号。通过使用 8 位 Adam 优化器和对代码本向量的加权交叉熵损失,在 40 个周期的微调后,模型实现了高水平的表情符号风格化,结果可通过公开的 Telegram 机器人实现自定义贴纸生成。
This technical report presents a text-to-image neural network "Emojich" that generates emojis using captions in Russian language as a condition. We aim to keep the generalization ability of a pretrained big model ruDALL-E Malevich (XL) 1.3B parameters at the fine-tuning stage, while giving special style to the images generated. Here are presented some engineering methods, code realization, all hyper-parameters for reproducing results and a Telegram bot where everyone can create their own customized sets of stickers. Also, some newly generated emojis obtained by "Emojich" model are demonstrated.
研究动机与目标
- 开发一种零样本文本到图像模型,无需向 Unicode 提出新表情符号,即可从俄语描述生成风格化的表情符号。
- 在适应输出风格以匹配表情符号美学的同时,保留预训练 ruDALL-E Malevich (XL) 模型的世界知识。
- 通过微调生成和自动分割技术,使用户能够通过公开的 Telegram 机器人生成个性化表情符号贴纸。
- 通过在图像代码本向量上使用高权重交叉熵损失,缓解因有限的描述变体而引起的过拟合问题。
- 开发一个强大且可扩展的流水线,将生成的表情符号图像转换为带透明背景的 RGBA 格式,使用 U-Net 和基于轮廓的分割技术。
提出的方法
- 通过冻结自注意力和前馈网络层,对 13 亿参数的 ruDALL-E Malevich (XL) 模型进行微调,以防止灾难性遗忘。
- 在图像代码本向量上应用系数为 10³ 的加权交叉熵损失,以强调风格适应,同时保持语义内容。
- 使用 8 位 Adam 优化器、fp16 精度和一阶段学习率调度器(初始 4e-7,峰值 1e-5,最终 2e-8),在 40 个周期内以批量大小 2 进行训练。
- 在 VQ-VAE 解码器中对潜在向量进行自回归解码时,采用核采样(top-p = 0.995)和 top-k = 2048,温度 = 1.0。
- 通过从 MobileStyleGAN 适配的逆离散小波变换(IDWT)模块,将图像分辨率从 256×256 提升至 512×512。
- 使用伪标签和人工校正方法,将训练集扩展至 246,089 张图像,训练一个基于 EfficientNetB7 编码器的 U-Net 模型,实现生成表情符号的二值语义分割。
实验结果
研究问题
- RQ1大规模多模态预训练模型如 ruDALL-E Malevich (XL) 是否能有效微调,以在不造成灾难性遗忘的情况下,从俄语描述生成风格化且文化适配的表情符号?
- RQ2在有限且模糊的描述数据下,模型如何在适应表情符号独特视觉风格的同时,保持高质量的图像生成能力?
- RQ3在低资源、高度风格化的数据集(如俄语表情符号)上微调大规模视觉-语言模型时,哪些训练与优化策略最为有效?
- RQ4如何实现自动且可靠的背景移除,以使生成的表情符号图像可直接用于消息平台?
- RQ5模型在面对新颖的、分布外的提示时,其泛化能力如何,同时又能保持身份一致性和表情符号美学特征?
主要发现
- 在 2,749 张带有俄语描述的表情符号图像上进行 40 个周期的微调后,模型成功从生成照片级真实图像过渡到风格化的表情符号输出。
- 模型在约 12,000 次迭代后开始生成可识别的表情符号风格图像,到 56,000 次迭代时已实现稳定的风格化。
- 在 68,000 次迭代后,模型开始出现语义保真度下降,生成均匀且缺乏个性的图像(例如,“爱因斯坦”被转化为一个留着胡子的陌生男子),表明出现过拟合或模式崩溃。
- 基于 U-Net 的分割流水线表现出高可靠性,置信度阈值(≥0.99)使 99% 的生成图像可实现自动化处理,其余情况通过人工基于轮廓的方法解决。
- 最终模型在 seed=42 和每条提示生成 16 个样本时,生成了适合直接用作贴纸的高质量表情符号图像,通过 512 个样本采样并人工筛选可进一步提升质量。
- 成功部署了公开的 Telegram 机器人,使用户能够使用微调后的 Emojich 模型和分割流水线生成并导出自定义表情符号贴纸集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。