[论文解读] Human-like Controllable Image Captioning with Verb-specific Semantic Roles
本文提出了一种新型可控图像描述控制信号——动词特定语义角色(VSR),通过将动词及其语义角色(如施事、位置等)与视觉实体对齐,确保事件兼容性和样本适用性。该框架采用基于视觉定位的语义角色标注模型、语义结构规划器和角色转移描述生成模型,生成高质量、多样化且类人化的描述,在 COCO Entities 数据集上,其在准确率和可控性方面均优于强基线模型。
Controllable Image Captioning (CIC) -- generating image descriptions following designated control signals -- has received unprecedented attention over the last few years. To emulate the human ability in controlling caption generation, current CIC studies focus exclusively on control signals concerning objective properties, such as contents of interest or descriptive patterns. However, we argue that almost all existing objective control signals have overlooked two indispensable characteristics of an ideal control signal: 1) Event-compatible: all visual contents referred to in a single sentence should be compatible with the described activity. 2) Sample-suitable: the control signals should be suitable for a specific image sample. To this end, we propose a new control signal for CIC: Verb-specific Semantic Roles (VSR). VSR consists of a verb and some semantic roles, which represents a targeted activity and the roles of entities involved in this activity. Given a designated VSR, we first train a grounded semantic role labeling (GSRL) model to identify and ground all entities for each role. Then, we propose a semantic structure planner (SSP) to learn human-like descriptive semantic structures. Lastly, we use a role-shift captioning model to generate the captions. Extensive experiments and ablations demonstrate that our framework can achieve better controllability than several strong baselines on two challenging CIC benchmarks. Besides, we can generate multi-level diverse captions easily. The code is available at: https://github.com/mad-red/VSR-guided-CIC.
研究动机与目标
- 为解决现有可控图像描述中客观控制信号的局限性,这些信号常无法保证事件兼容性和样本适用性。
- 提出一种新型控制信号——动词特定语义角色(VSR),其天然保证与所描述活动的兼容性,并适用于单个图像样本。
- 通过从 VSR 输入中学习类人化的语义结构,实现多样化、高质量描述的生成。
- 证明 VSR 在生成描述质量与可控性方面优于最先进基线模型。
- 探索 VSR 在多层级描述多样性及零样本结构泛化方面的潜力。
提出的方法
- 提出动词特定语义角色(VSR)作为控制信号,由动词及其关联的语义角色(如施事、位置、工具等)组成,确保事件兼容性。
- 训练一个基于视觉定位的语义角色标注(GSRL)模型,以识别并定位 VSR 中每个语义角色对应的视觉实体。
- 设计一个语义结构规划器(SSP),从 VSR 和定位到的视觉区域中学习类人化的描述结构(如“施事在位置进行动词”)。
- 开发一种角色转移描述生成模型,通过条件输入 VSR、定位到的语义角色及学习到的语义结构,生成流畅的描述。
- 使用束搜索(beam search)通过为同一 VSR 采样不同的语义结构,生成多个多样化描述。
- 利用 VSR 的内在结构,实现对未见角色组合的零样本泛化,如图 6 所示,发现了训练数据中未出现的新型语义结构。
实验结果
研究问题
- RQ1基于动词特定语义角色的控制信号能否提升可控图像描述中生成描述的事件兼容性?
- RQ2VSR 是否能通过适用于实际包含所描述活动的图像,确保样本适用性?
- RQ3所提出的框架能否在准确率和可控性方面优于现有基线,生成多样化且高质量的描述?
- RQ4语义结构规划器能否从 VSR 输入中学习到类人化的描述句式?
- RQ5该框架能否泛化到未见的角色组合,并发现训练数据中不存在的新语义结构?
主要发现
- 所提出的基于 VSR 的框架在 COCO Entities 数据集上达到 267.3 的 CIDEr 分数,显著优于 SCT 基线(222.5)和 BS 基线(209.5),在相同设置下实现多样化描述生成。
- 在每张图像生成六条多样化描述时,该框架的基于准确率的指标(CIDEr: 59.8)高于 SCT 基线(55.4)和 BS 基线(52.1)。
- 语义结构规划器(SSP)成功学习并泛化到新型语义结构,包括原始训练数据中未出现的结构,如图 6 所示,发现了此前未见的结构(蓝色标记处)。
- 该框架生成的描述质量更高,可控性更强,在描述质量与多样性之间实现了更优的权衡,尽管在 self-CIDEr 上的多样性得分略低(67.0 vs. 69.1 for SCT)。
- 图 7 的可视化结果证实,生成的描述与给定的 VSR 有效对齐,且通过改变 VSR 可生成语义上不同且多样的描述。
- 消融实验表明,GSRL 和 SSP 组件对实现高性能均至关重要,任一组件移除后性能均出现显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。