[论文解读] Comprehension-guided referring expressions
本文提出了一种新颖的框架,通过利用预训练的 comprehension 模型作为训练信号或重排序标准,生成高质量的指代表达。通过在训练期间(通过可微分代理损失)或推理期间(通过生成并重排序)利用 comprehension 模型引导生成,该方法显著提升了流畅性和指代准确性,在 RefCOCO 和 RefCOCO+ 上的自动评估与人工评估中均优于基线模型。
We consider generation and comprehension of natural language referring expression for objects in an image. Unlike generic "image captioning" which lacks natural standard evaluation criteria, quality of a referring expression may be measured by the receiver's ability to correctly infer which object is being described. Following this intuition, we propose two approaches to utilize models trained for comprehension task to generate better expressions. First, we use a comprehension module trained on human-generated expressions, as a "critic" of referring expression generator. The comprehension module serves as a differentiable proxy of human evaluation, providing training signal to the generation module. Second, we use the comprehension module in a generate-and-rerank pipeline, which chooses from candidate expressions generated by a model according to their performance on the comprehension task. We show that both approaches lead to improved referring expression generation on multiple benchmark datasets.
研究动机与目标
- 通过将 comprehension 模型作为训练信号或推理标准,提升指代表达生成的质量。
- 通过将指代准确性作为人类理解能力的代理指标,解决图像字幕任务中缺乏可靠评估指标的问题。
- 开发一种协作式训练框架,在避免 GAN 式训练不稳定性的同时,利用判别性反馈。
- 在标准基准上评估训练阶段与推理阶段整合 comprehension 模型的有效性。
提出的方法
- 在人类标注的指代表达上训练一个独立的 comprehension 模型,以根据给定的表达预测正确的图像区域。
- 在训练期间使用训练好的 comprehension 模型作为可微分代理,提供判别性损失,以促使生成器产出更易理解的表达。
- 实施一种“代理训练”方法,将交叉熵损失与基于 comprehension 的损失相结合,联合优化生成器。
- 在推理阶段采用“生成并重排序”策略,即生成多个候选表达,并选择 comprehension 得分最高的表达。
- 将 comprehension 模型调整为对输入表达可微分,从而实现通过生成器的端到端反向传播。
- 探索多种训练策略,包括复合损失、改进的调度采样以及随机混合增量交叉熵,以稳定优化过程。
实验结果
研究问题
- RQ1预训练的 comprehension 模型能否有效引导生成更具可理解性的指代表达?
- RQ2在训练期间整合 comprehension 反馈是否能带来比标准自回归训练更好的泛化性能?
- RQ3使用 comprehension 评分进行生成并重排序的推理策略,与使用代理监督的端到端训练相比表现如何?
- RQ4为何性能在不同测试划分(如 RefCOCO+ TestA 与 TestB)之间存在差异?其影响因素是什么?
- RQ5不同的训练目标(如复合损失、SMIXEC)是否能在多个数据集上带来一致的性能提升?
主要发现
- 在 RefCOCO TestB 上,生成并重排序方法的人工评估准确率达到 75%,显著优于基线 MMI 方法(61%)。
- 在 RefCOCO 上,SMIXEC 代理训练方法达到 68% 的 comprehension 准确率,超过基线 MMI 方法(61%),且流畅性指标更优。
- 生成并重排序方法的 BLEU 和 CIDEr 得分均高于所有基线,表明生成表达在流畅性和多样性方面表现更佳。
- 人工评估确认,SMIXEC 和重排序两种方法生成的指代表达比基线 MMI 模型更具信息量和准确性。
- 在 RefCOCO+ 上,SMIXEC 方法在 TestA 上达到 46% 的人工准确率,而重排序方法在 TestB 上达到 47%,表明其在不同测试划分间具有强大的泛化能力。
- 生成并重排序方法优于简单的采样基线(MLE+sample),证明了基于 comprehension 的重排序在采样之外带来了额外价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。