Skip to main content
QUICK REVIEW

[论文解读] Kaleido-BERT: Vision-Language Pre-training on Fashion Domain

Mingchen Zhuge, Dehong Gao|arXiv (Cornell University)|Mar 30, 2021
Multimodal Machine Learning Applications参考文献 81被引用 13
一句话总结

Kaleido-BERT 是一种用于时尚领域的视觉-语言预训练模型,引入了一种新颖的kaleido策略,结合对齐引导掩码和多尺度图像块级自监督任务。它在四项下游任务中均达到最先进性能,包括图像检索的R@1提升7.13个百分点,类别识别提升3.28个百分点。

ABSTRACT

We present a new vision-language (VL) pre-training model dubbed Kaleido-BERT, which introduces a novel kaleido strategy for fashion cross-modality representations from transformers. In contrast to random masking strategy of recent VL models, we design alignment guided masking to jointly focus more on image-text semantic relations. To this end, we carry out five novel tasks, i.e., rotation, jigsaw, camouflage, grey-to-color, and blank-to-color for self-supervised VL pre-training at patches of different scale. Kaleido-BERT is conceptually simple and easy to extend to the existing BERT framework, it attains new state-of-the-art results by large margins on four downstream tasks, including text retrieval (R@1: 4.03% absolute improvement), image retrieval (R@1: 7.13% abs imv.), category recognition (ACC: 3.28% abs imv.), and fashion captioning (Bleu4: 1.2 abs imv.). We validate the efficiency of Kaleido-BERT on a wide range of e-commerical websites, demonstrating its broader potential in real-world applications.

研究动机与目标

  • 在通用领域预训练之外,提升时尚领域特定的视觉-语言跨模态表征学习能力。
  • 通过引入基于对齐的引导掩码,解决现有视觉-语言模型中随机掩码的局限性,增强语义关系学习能力。
  • 设计针对时尚领域特征(如颜色、纹理和风格)量身定制的自监督预训练任务。
  • 开发一种简单但高效的框架,无缝集成至BERT架构中,实现对下游时尚应用的高效微调。
  • 在电商平台真实场景中验证模型的实际有效性,证明其在生产环境中的可扩展性和鲁棒性。

提出的方法

  • 提出Kaleido图像块生成器(KPG),从时尚图像中生成多尺度、对图像块不变的表征,提升细粒度特征学习能力。
  • 采用基于注意力的对齐生成器(AAG),学习图像块与文本标记之间的跨模态注意力,增强语义对齐。
  • 提出对齐引导掩码(AGM),根据学习到的语义对齐结果,选择性地掩码图像和文本特征,提升联合表征学习效果。
  • 设计五种新颖的自监督预训练任务——旋转、拼图、伪装、灰度转彩色、空白转彩色——在不同图像块尺度上应用,以学习鲁棒的视觉与语言表征。
  • 采用统一的单流Transformer架构,支持端到端训练,并可高效适配下游任务。
  • 应用自适应损失函数和图像块级监督,增强特征学习,同时保持与标准BERT微调方式的兼容性。
Figure 1: Different utilization of alignment information in VL pre-training architectures. T = Task . W = Word . V = Visual Token . L = Object Detection Label . E = Embedding . Trm = Transformer Block .
Figure 1: Different utilization of alignment information in VL pre-training architectures. T = Task . W = Word . V = Visual Token . L = Object Detection Label . E = Embedding . Trm = Transformer Block .

实验结果

研究问题

  • RQ1与随机掩码相比,对齐引导掩码是否能提升时尚视觉-语言任务中的跨模态表征学习?
  • RQ2多尺度、图像块级的自监督预训练任务是否能增强时尚领域视觉-语言理解的特征学习?
  • RQ3Kaleido-BERT 在时尚领域特定的下游任务中,与现有视觉-语言模型相比性能如何?
  • RQ4与固定尺度或随机图像块采样相比,kaleido图像块生成策略在特征表征方面提升程度如何?
  • RQ5所提出的框架是否能在真实世界电商平台系统中高效部署,同时保持高性能?

主要发现

  • 在Fashion-Gen基准测试中,Kaleido-BERT 相较于先前SOTA模型,图像检索性能(R@1)绝对提升7.13个百分点。
  • 文本检索性能提升4.03个百分点(R@1),表明其具备更优的跨模态匹配能力。
  • 类别识别准确率提升3.28个百分点,表明对时尚属性的语义理解能力显著增强。
  • 时尚图像字幕生成性能提升1.2个BLEU-4分数,表明生成质量更高且与输入图像更匹配。
  • 消融实验表明,与随机掩码相比,对齐引导掩码在Sum R指标上提升6.7个百分点,证明其有效性。
  • 五种新颖预训练任务(旋转、拼图、伪装、灰度转彩色、空白转彩色)的集成,在所有下游任务中均带来一致的性能提升。
Figure 2: Illustration of KPG. See \secref sec:KPG for details.
Figure 2: Illustration of KPG. See \secref sec:KPG for details.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。