[论文解读] Tagging like Humans: Diverse and Distinct Image Annotation
该论文提出 D2IA-GAN,一种生成对抗网络模型,通过利用行列式点过程(DPPs)实现语义上的独特性,并通过随机噪声扰动实现子集间的多样性,从而生成多样且独特的图像标签。该模型在人工标注数据上进行训练,在定量指标和人工评估中均优于最先进方法,生成的图像描述更加全面、更接近人类表达,且冗余度更低。
In this work we propose a new automatic image annotation model, dubbed {\bf diverse and distinct image annotation} (D2IA). The generative model D2IA is inspired by the ensemble of human annotations, which create semantically relevant, yet distinct and diverse tags. In D2IA, we generate a relevant and distinct tag subset, in which the tags are relevant to the image contents and semantically distinct to each other, using sequential sampling from a determinantal point process (DPP) model. Multiple such tag subsets that cover diverse semantic aspects or diverse semantic levels of the image contents are generated by randomly perturbing the DPP sampling process. We leverage a generative adversarial network (GAN) model to train D2IA. Extensive experiments including quantitative and qualitative comparisons, as well as human subject studies, on two benchmark datasets demonstrate that the proposed model can produce more diverse and distinct tags than the state-of-the-arts.
研究动机与目标
- 为解决自动图像标注中缺乏多样性和独特性的问题,现有方法常生成冗余且语义相似的标签。
- 模拟人类标注者生成语义上不同但全面的标签集合,覆盖多个语义层次和图像方面。
- 开发一种生成模型,为每张图像生成多个不同的标签子集,每个子集捕捉图像内容的不同语义方面。
- 采用 GAN 框架结合策略梯度优化方法训练模型,以处理 DPP 采样步骤的不可微性。
- 通过定量指标和人工受试者研究验证模型在标签质量与多样性方面的优越性。
提出的方法
- 该模型使用深度神经网络将图像特征和随机噪声向量映射到候选标签的后验分布。
- 在标签后验上应用行列式点过程(DPP)模型,通过顺序采样生成语义上不同的标签序列。
- 通过使用不同随机噪声向量采样 DPP,生成多个具有多样性的标签子集,确保覆盖不同的语义方面。
- 生成器在 GAN 框架中进行训练,判别器负责区分真实的人工标注标签子集与生成的标签子集。
- 尽管 DPP 采样操作不可微,仍采用策略梯度方法优化生成器。
- 模型在大规模人工标注数据集(包括 IAPRTC-12 和 ESP Game)上进行端到端训练。
实验结果
研究问题
- RQ1深度生成模型能否生成既在语义上不同又在多个子集间具有多样性的图像标签,从而模拟人类标注者的行为?
- RQ2将 DPP 与噪声扰动采样相结合,相比基线方法,能否显著提升标签的多样性和独特性?
- RQ3在人工评估中,D2IA-GAN 模型生成的标签集合与最先进方法相比,其人类相似度如何,是否更接近人类标注?
- RQ4F1-sp 指标在预测人类对标签子集质量偏好的可靠性如何?
- RQ5语义层次建模对生成标签的质量与连贯性有何影响?
主要发现
- 在 ESP Game 数据集上,D2IA-GAN 在 3 个标签图像中 64% 的情况下优于 DIA 的人工评估表现,在 5 个标签图像中为 62.96%。
- 在 F1-sp 评估中,D2IA-GAN 在 3 个标签图像中 66.67% 的情况下优于 DIA,在 5 个标签图像中为 65.43%,显示出与人类判断的一致性。
- 在 ESP Game 上,人工评估与 F1-sp 评估的一致性达到 63.73%,表明该自动化指标具有可靠性。
- 在 IAPRTC-12 上,D2IA-GAN 在 3 个标签子集中的人工评估与 F1-sp 评估一致性为 69.01%,在 5 个标签子集中为 57.52%。
- 与 DIA 相比,D2IA-GAN 生成了更全面、更接近人类的标签集合,语义冗余更少,对图像语义的覆盖更充分。
- 补充分析证实,D2IA-GAN 更好地捕捉了多层次语义描述(如 'church' 与 'building' 的区分),并聚焦于图像的不同元素,与人类标注者行为一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。