Skip to main content
QUICK REVIEW

[论文解读] Fashion Captioning: Towards Generating Accurate Descriptions with Semantic Rewards

Xuewen Yang, Heming Zhang|arXiv (Cornell University)|Aug 6, 2020
Multimodal Machine Learning Applications参考文献 43被引用 10
一句话总结

本文提出了一种基于强化学习的新型时尚图像描述生成框架,通过整合属性级语义(ALS)奖励与句子级语义(SLS)奖励,提升描述的准确性和表现力。通过在新构建的大规模数据集(FACAD)上联合使用最大似然估计、属性嵌入与强化学习进行训练,该模型生成的描述在准确度、细节丰富度和吸引力方面均优于现有方法,在自动评估与人工评估中均达到最先进性能。

ABSTRACT

Generating accurate descriptions for online fashion items is important not only for enhancing customers' shopping experiences, but also for the increase of online sales. Besides the need of correctly presenting the attributes of items, the expressions in an enchanting style could better attract customer interests. The goal of this work is to develop a novel learning framework for accurate and expressive fashion captioning. Different from popular work on image captioning, it is hard to identify and describe the rich attributes of fashion items. We seed the description of an item by first identifying its attributes, and introduce attribute-level semantic (ALS) reward and sentence-level semantic (SLS) reward as metrics to improve the quality of text descriptions. We further integrate the training of our model with maximum likelihood estimation (MLE), attribute embedding, and Reinforcement Learning (RL). To facilitate the learning, we build a new FAshion CAptioning Dataset (FACAD), which contains 993K images and 130K corresponding enchanting and diverse descriptions. Experiments on FACAD demonstrate the effectiveness of our model.

研究动机与目标

  • 为解决时尚单品图像描述生成中因细粒度属性与风格表达带来的挑战,提升描述的准确性和表现力。
  • 克服最大似然估计(MLE)在图像描述任务中的局限性,其无法有效强调关键属性与全局语义。
  • 设计一种新型学习框架,结合最大似然估计、属性嵌入与强化学习,并引入创新的语义奖励机制。
  • 构建首个大规模时尚图像描述数据集FACAD,包含993K张图像与130K条多样化、富有吸引力的描述。
  • 通过自定义奖励函数显式建模属性一致性与句子级语义含义,以提升描述质量。

提出的方法

  • 提出基于属性匹配算法的属性级语义(ALS)奖励,确保生成的描述准确描述物品属性。
  • 提出基于预训练句子分类器的句子级语义(SLS)奖励,以保持描述的高层语义一致性。
  • 将视觉属性预测作为监督信号,以提升图像特征质量并确保属性提取的准确性。
  • 采用基于预测属性条件化的LSTM解码器,生成更相关且更具描述性的文本。
  • 联合使用最大似然估计(MLE)、属性嵌入与强化学习(RL)进行端到端训练。
  • 利用FACAD数据集——包含993K张时尚图像,附带丰富的属性、类别与富有表现力的描述注释——进行模型训练与评估。

实验结果

研究问题

  • RQ1与基于MLE的基线方法相比,采用语义奖励的强化学习框架是否能显著提升时尚图像描述的准确度与表现力?
  • RQ2所提出的属性级语义(ALS)奖励在提升生成描述中属性描述一致性方面效果如何?
  • RQ3句子级语义(SLS)奖励在多大程度上提升了生成描述的语义连贯性与类别一致性?
  • RQ4模型是否能通过学习具有共享属性的相似物品,泛化生成多样且富有吸引力的描述?
  • RQ5属性嵌入与视觉属性预测的结合在多大程度上提升了整体描述生成性能?

主要发现

  • 所提出的SRFC模型在人工偏好评估中获得19.7%的最高偏好率,显著优于所有基线模型。
  • 在自动评估中,模型取得37.5 BLEU-4、20.6 ROUGE-L与10.1 CIDEr的得分,表明其在标准指标上表现优异。
  • 模型在属性一致性方面表现卓越,即使在真实标注中未出现“notched lapel”等属性,也能正确识别并描述。
  • 定性分析显示,模型能从相似样本中学习富有表现力的短语,并将其迁移至新目标,从而提升描述的多样性与丰富性。
  • SRFC模型的Fleiss’ kappa一致性系数达0.63,表明人工评估者之间具有一致性,验证了人工评估结果的可靠性。
  • 消融实验表明,结合ALS与SLS奖励、MLE与属性嵌入的多目标训练框架性能最优,验证了该框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。