Skip to main content
QUICK REVIEW

[论文解读] A Joint Speaker-Listener-Reinforcer Model for Referring Expressions

Licheng Yu, Hao Tan|arXiv (Cornell University)|Dec 30, 2016
Multimodal Machine Learning Applications参考文献 11被引用 5
一句话总结

本文提出了一种联合说话者-听者-强化模块模型,用于指代表达的生成与理解,其中说话者生成表达,听者理解这些表达,而强化模块则通过优化判别性、无歧义的表达来提升性能。该框架通过端到端训练和基于奖励的重排序机制,在三个基于MSCOCO的指代表达数据集上实现了最先进性能。

ABSTRACT

Referring expressions are natural language constructions used to identify particular objects within a scene. In this paper, we propose a unified framework for the tasks of referring expression comprehension and generation. Our model is composed of three modules: speaker, listener, and reinforcer. The speaker generates referring expressions, the listener comprehends referring expressions, and the reinforcer introduces a reward function to guide sampling of more discriminative expressions. The listener-speaker modules are trained jointly in an end-to-end learning framework, allowing the modules to be aware of one another during learning while also benefiting from the discriminative reinforcer's feedback. We demonstrate that this unified framework and training achieves state-of-the-art results for both comprehension and generation on three referring expression datasets. Project and demo page: https://vision.cs.unc.edu/refer

研究动机与目标

  • 开发一个统一框架,联合建模指代表达任务中的说话者与听者行为。
  • 通过引入基于判别性奖励的强化模块,解决指代表达中的歧义问题。
  • 通过说话者与听者模块的端到端训练与相互监督,同时提升指代表达的生成与理解性能。
  • 在使用目标检测器而非真实边界框的情况下,证明模型在真实场景下的鲁棒性能。

提出的方法

  • 该模型整合了三个组件:基于LSTM的解码器作为说话者,生成指代表达;基于嵌入的模型作为听者,理解表达;以及使用强化学习优化判别性表达的强化模块。
  • 说话者与听者以端到端方式联合训练,实现在学习过程中相互反馈。
  • 强化模块采用判别性奖励函数,对歧义表达施加惩罚,引导说话者生成更具唯一性的描述。
  • 通过听者与强化模块应用重排序机制,对场景中所有对象的表达进行全局优化。
  • 框架使用联合嵌入空间进行理解,使用条件语言模型进行生成,并采用贝叶斯推理计算定位的后验概率。
  • 模型通过交叉熵损失用于生成任务,结合基于判别准确率的奖励信号进行强化学习进行训练。

实验结果

研究问题

  • RQ1统一框架能否通过相互监督联合优化指代表达的生成与理解?
  • RQ2引入判别性奖励函数在多大程度上提升了生成表达的质量与独特性?
  • RQ3与独立训练相比,说话者与听者模块的端到端联合训练在多大程度上提升了性能?
  • RQ4当使用自动目标检测而非真实边界框时,联合模型是否仍能保持强性能?

主要发现

  • 包含重排序的完整模型在RefCOCO测试集A和B上的准确率分别达到76.95%和78.10%,优于先前最先进方法。
  • 在RefCOCO+数据集上,模型在测试集A和B上的准确率分别达到58.85%和58.20%,创下新的最先进结果。
  • 加入强化模块后,理解性能相比无此模块的模型最高提升2.8%,尤其在歧义场景下表现更优。
  • 人工评估确认,带有重排序的联合模型生成的表达比基线模型更准确且更无歧义。
  • 即使在使用SSD目标检测器(置信度阈值为0.3)时,模型仍保持强性能,表明对检测误差具有鲁棒性。
  • 消融实验确认,听者、强化模块与重排序机制各自独立地对性能提升有贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。