Skip to main content
QUICK REVIEW

[论文解读] 15M Multimodal Facial Image-Text Dataset

Dawei Dai, YuTang Li|ArXiv.org|Jul 11, 2024
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文介绍了 FaceCaption-15M,这是目前公开可用的最大规模面部图像-文本数据集,包含超过1500万对高质量、多样化且自然描述的面部图像-文本对。作者基于该数据集训练了一个类似CLIP的模型(FLIP),在面部属性识别、图文检索以及基于草图的面部检索任务中均取得了最先进性能,证明了该数据集在以面部为中心的多模态学习中的有效性。

ABSTRACT

Currently, image-text-driven multi-modal deep learning models have demonstrated their outstanding potential in many fields. In practice, tasks centered around facial images have broad application prospects. This paper presents extbf{FaceCaption-15M}, a large-scale, diverse, and high-quality dataset of facial images accompanied by their natural language descriptions (facial image-to-text). This dataset aims to facilitate a study on face-centered tasks. FaceCaption-15M comprises over 15 million pairs of facial images and their corresponding natural language descriptions of facial features, making it the largest facial image-caption dataset to date. We conducted a comprehensive analysis of image quality, text naturalness, text complexity, and text-image relevance to demonstrate the superiority of FaceCaption-15M. To validate the effectiveness of FaceCaption-15M, we first trained a facial language-image pre-training model (FLIP, similar to CLIP) to align facial image with its corresponding captions in feature space. Subsequently, using both image and text encoders and fine-tuning only the linear layer, our FLIP-based models achieved state-of-the-art results on two challenging face-centered tasks. The purpose is to promote research in the field of face-related tasks through the availability of the proposed FaceCaption-15M dataset. All data, codes, and models are publicly available. https://huggingface.co/datasets/OpenFace-CQUPT/FaceCaption-15M

研究动机与目标

  • 为解决多模态面部相关任务中缺乏大规模、高质量且图像-文本对齐性强的面部图像-文本数据集的问题。
  • 开发一种可扩展、自动化的流水线,用于为面部图像生成自然、详细且相关的描述。
  • 通过在下游以面部为中心的任务上训练一个面部语言-图像预训练模型(FLIP)并进行评估,验证该数据集的实用性。
  • 通过公开可用的高质量数据集,推动面部属性识别、图文检索以及基于草图的面部检索领域的研究。
  • 在数据收集与标注过程中确保公平性并尽量减少偏差,同时解决潜在滥用相关的伦理问题。

提出的方法

  • 首先使用RetinaFace从LAION-Face中提取面部区域,确保获得高质量、以面部为中心的图像。
  • 利用He等人[26]提出的方法预测面部属性(如性别、发色等),以增强图像-文本对齐效果。
  • 通过结合语法模板与大型语言模型(LLM)的混合方法生成自然语言描述,以确保语言多样性与相关性。
  • 在FaceCaption-15M上训练一个类似CLIP的对比学习模型FLIP,以在共享特征空间中对齐图像与文本嵌入。
  • 仅通过图像和文本编码器的线性层进行微调,实现对下游任务的高效适应。
  • 在三个基准任务上进行评估:面部属性识别、图文检索以及基于草图的面部检索(SLFIR)。

实验结果

研究问题

  • RQ1大规模、多样化且高质量的面部图像-文本数据集是否能显著提升多模态面部相关模型的性能?
  • RQ2通过自动生成并经LLM增强的描述流水线,在保持高图像-文本相关性与自然性方面效果如何?
  • RQ3在FaceCaption-15M上进行预训练,能在多大程度上提升面部属性识别与检索任务的零样本及微调性能?
  • RQ4在低资源或基于草图的场景下,基于FaceCaption-15M训练的FLIP模型是否比在LAION-Face上预训练的模型泛化能力更强?
  • RQ5该数据集与模型是否能在保持公平性与伦理完整性的同时,减轻面部属性识别与描述中的偏差?

主要发现

  • FaceCaption-15M包含超过1500万对图像-文本对,在规模、图像质量与文本相关性方面均超越现有数据集。
  • 在SLFIR基准上,基于FaceCaption-15M预训练的FLIP模型取得了99.49 m@A与71.10 m@B的性能,优于所有基线模型,包括在LAION-Face上预训练的CLIP与FLIP模型。
  • 在基于草图的面部检索任务中,基于FLIP的模型仅用少量草图笔画即可在前5名内检索到正确的人脸,展现出优异的早期检索性能。
  • 在FaceCaption-15M上微调的FLIP模型在用户SDE评估中显著优于在LAION-Face上预训练的FLIP模型,表明其对多样化草图风格具有更强的泛化能力。
  • 统计分析证实,描述具有高自然性(平均30个词/条)、强图像-文本相关性,且背景干扰极少,验证了数据集的高质量。
  • 该数据集展现出强公平性与低偏差,通过精心的筛选与伦理保障措施,防止滥用,包括生物特征数据泄露。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。