Skip to main content
QUICK REVIEW

[论文解读] Face2Text: Collecting an Annotated Image Description Corpus for the Generation of Rich Face Descriptions

Albert Gatt, Marc Tanti|arXiv (Cornell University)|Mar 10, 2018
Multimodal Machine Learning Applications参考文献 26被引用 17
一句话总结

本文提出 Face2Text,一个大规模、众包收集的丰富人脸图像文本描述语料库,这些描述来自真实场景('in the wild')中的人类标注。研究发现,描述通常混合了物理特征、情绪特征和推断性特征——这挑战了当前仅关注具体视觉特征的图像到文本生成模型,从而推动了细粒度、上下文感知人脸描述生成技术的前沿发展。

ABSTRACT

The past few years have witnessed renewed interest in NLP tasks at the interface between vision and language. One intensively-studied problem is that of automatically generating text from images. In this paper, we extend this problem to the more specific domain of face description. Unlike scene descriptions, face descriptions are more fine-grained and rely on attributes extracted from the image, rather than objects and relations. Given that no data exists for this task, we present an ongoing crowdsourcing study to collect a corpus of descriptions of face images taken `in the wild'. To gain a better understanding of the variation we find in face description and the possible issues that this may raise, we also conducted an annotation study on a subset of the corpus. Primarily, we found descriptions to refer to a mixture of attributes, not only physical, but also emotional and inferential, which is bound to create further challenges for current image-to-text methods.

研究动机与目标

  • 创建一个大规模、多样化的真人生成的面部图像文本描述语料库,数据来源于真实世界场景('in the wild')。
  • 研究人类面部描述的语义与句法复杂性,特别是物理、情绪和推断属性的混合特征。
  • 评估描述类别上的人工标注者间一致性,并识别定义细微属性(如推断与情绪)的挑战。
  • 通过提供训练和评估先进自然语言生成(NLG)模型的数据基础,支持未来自动面部描述生成的研究。
  • 探索数据增强技术与细粒度语义标注,以提升模型在面部描述任务中的可解释性与性能。

提出的方法

  • 开展众包研究,从非专业标注者处收集真实世界面部图像的自由文本描述。
  • 设计五类标注方案(物理、情绪、推断、社会及其他),用于分类描述的语义内容。
  • 使用 Fleiss’ Kappa 进行标注者间一致性研究,评估各类别间的可靠性,尤其关注模糊类别如“推断”。
  • 收集标注者的背景与上下文元数据,以探究背景如何影响描述的显著性与风格。
  • 探索半自动数据增强方法,通过网络搜索寻找相似图像,并从周围内容中提取匹配的文本描述。
  • 计划未来对描述进行细粒度标注,以标记特定属性(如发色、情绪、种族等),以提升模型训练与评估的精度。

实验结果

研究问题

  • RQ1在自然场景中,人类在描述面部图像时通常包含哪些类型的属性(物理、情绪、推断)?
  • RQ2人类标注者在分类面部描述语义类别时的可靠性如何,尤其是对模糊类别如“推断”?
  • RQ3人口统计因素(如年龄、性别、文化背景)在多大程度上影响面部描述中属性的显著性与类型?
  • RQ4如何利用现有图像-描述对,通过基于网络的图像搜索与周围文本挖掘来增强数据集?
  • RQ5当描述包含非视觉、推断性或情绪性内容时,训练自动面部描述系统面临的主要挑战是什么?

主要发现

  • 该语料库中的描述主要包含物理属性,但相当大比例也包含情绪和推断元素,表明其具有高度的语义复杂性。
  • 物理和情绪类别的标注者间一致性为中等到高,但“推断”类别的一致性较低,表明需要更清晰的定义与培训。
  • 各类别间一致性平均 Fleiss’ Kappa 为 0.45,范围在 -0.19 到 0.88 之间;去除一个异常值后,平均值提升至 0.60,表明经优化后具有可接受的一致性。
  • 该语料库捕捉到了广泛的句法与语义多样性,反映了真实世界中人类描述行为的复杂性,远超简单的物体标注。
  • 情绪与推断属性(如“严肃”、“懊悔”或“正在为自己辩护”)经常被提及,凸显了情感与上下文理解在描述中的重要性。
  • 通过半自动网络挖掘方法正在扩展数据集,以提升规模与多样性,未来计划应用细粒度语义标注,以支持更精确的评估与模型训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。