Skip to main content
QUICK REVIEW

[论文解读] Analysis of diversity-accuracy tradeoff in image captioning

Ruotian Luo, Gregory Shakhnarovich|arXiv (Cornell University)|Feb 27, 2020
Multimodal Machine Learning Applications参考文献 34被引用 11
一句话总结

本文通过在最先进模型上评估各种解码策略、训练目标和超参数,研究了图像字幕生成中的多样性-准确率权衡问题。研究发现,采用低温的朴素采样能生成多样且准确的字幕集合,而基于CIDEr的强化学习会损害多样性,且无法通过调整解码策略恢复。作者提出了AllSPICE,一种结合SPICE(准确率)与自相似CIDEr(多样性)的新度量,可实现对字幕集合的联合评估。

ABSTRACT

We investigate the effect of different model architectures, training objectives, hyperparameter settings and decoding procedures on the diversity of automatically generated image captions. Our results show that 1) simple decoding by naive sampling, coupled with low temperature is a competitive and fast method to produce diverse and accurate caption sets; 2) training with CIDEr-based reward using Reinforcement learning harms the diversity properties of the resulting generator, which cannot be mitigated by manipulating decoding parameters. In addition, we propose a new metric AllSPICE for evaluating both accuracy and diversity of a set of captions by a single value.

研究动机与目标

  • 系统评估模型架构、训练目标、超参数和解码策略对生成图像字幕集合的多样性与准确率的影响。
  • 识别无需复杂模型修改的、有效且简单的多样化与准确字幕集合生成方法。
  • 提出一种新度量AllSPICE,可在一个评分中同时评估字幕集合的准确率与多样性。
  • 探究在不同解码设置下,CIDEr优化模型是否能实现比交叉熵训练模型更好的多样性-准确率平衡。
  • 阐明采样温度及其他解码超参数在控制多样性-准确率权衡中的作用。

提出的方法

  • 以带有512个隐藏单元的注意力机制LSTM模型作为基础生成器,采用三种训练目标:交叉熵(XE)、基于CIDEr的强化学习(RL)以及两者结合(XE+RL)。
  • 采用多种解码策略:朴素采样(SP)、top-K采样、核采样(top-p)、束搜索(BS)和多样化束搜索(DBS),每种策略均可调节温度和原生超参数。
  • 提出AllSPICE,一种基于SPICE的度量,通过测量与真实标注的相似性以及字幕之间的异质性,联合评估字幕集合的准确率与多样性。
  • 使用mBLEU、Distinct-1/2、Self-CIDEr、词汇表大小和%新句子数衡量多样性;使用SPICE和CIDEr衡量准确率。
  • 在实验中固定模型参数,以隔离解码和超参数选择对多样性-准确率权衡的影响。
  • 在COCO数据集上使用标准划分评估模型,并报告多个图像和字幕集合的指标。

实验结果

研究问题

  • RQ1与标准束搜索或其他解码策略相比,低温(T=0.5)的朴素采样是否能生成更多样且更准确的字幕集合?
  • RQ2即使采用最优解码超参数,基于CIDEr的强化学习是否仍能改善多样性-准确率权衡,相比交叉熵训练?
  • RQ3通过不同解码方法(如低温采样或top-p采样)能否在一定程度上从CIDEr优化模型中恢复多样性?
  • RQ4所提出的AllSPICE度量在单一统一评分中捕捉字幕集合的准确率与多样性的有效性如何?
  • RQ5在字幕生成中,采样温度、top-K和核采样对多样性-准确率权衡的相对影响是什么?

主要发现

  • 低温(T=0.5)的朴素采样持续生成最多样化的字幕集合,同时保持高准确率,优于束搜索和其他解码方法。
  • 基于CIDEr的强化学习显著降低了字幕多样性,且该负面影响无法通过调节温度或束大小等解码超参数来缓解。
  • 在使用多样化采样策略解码时,XE+RL训练目标的CIDEr得分更高,但多样性低于仅使用XE训练的模型。
  • AllSPICE能有效同时捕捉准确率与多样性,与人类判断具有强相关性,在联合评估中优于单独度量。
  • 中等温度(T=0.75)下的top-K和核采样产生的输出多样性高于束搜索,但低于低温朴素采样。
  • 本研究证明,像低温采样这样的简单、低成本解码策略,可实现比CIDER-RL等复杂训练目标更好的多样性-准确率平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。