[论文解读] What Should I Ask? Using Conversationally Informative Rewards for Goal-Oriented Visual Dialog
本文提出了一种端到端的目标导向视觉对话系统,利用正则化信息增益(RIG)与强化学习生成具有策略性、上下文相关的提问,以识别图像中的对象。通过在理性言语行为框架下建模人类的探究过程,该方法提升了提问的相关性并减少了冗余,从而在 GuessWhat?! 数据集上实现了 67.19% 的新 SOTA 准确率。
The ability to engage in goal-oriented conversations has allowed humans to gain knowledge, reduce uncertainty, and perform tasks more efficiently. Artificial agents, however, are still far behind humans in having goal-driven conversations. In this work, we focus on the task of goal-oriented visual dialogue, aiming to automatically generate a series of questions about an image with a single objective. This task is challenging since these questions must not only be consistent with a strategy to achieve a goal, but also consider the contextual information in the image. We propose an end-to-end goal-oriented visual dialogue system, that combines reinforcement learning with regularized information gain. Unlike previous approaches that have been proposed for the task, our work is motivated by the Rational Speech Act framework, which models the process of human inquiry to reach a goal. We test the two versions of our model on the GuessWhat?! dataset, obtaining significant results that outperform the current state-of-the-art models in the task of generating questions to find an undisclosed object in an image.
研究动机与目标
- 开发一种能够生成具有策略性、上下文感知问题的目标导向视觉对话系统,以识别图像中的对象。
- 利用理性言语行为框架建模类人探究行为,强调信息增益与提问成本。
- 通过正则化奖励函数最小化冗余或无信息量的问题,提升对话效率。
- 在 GuessWhat?! 基准测试中超越现有基线模型,在准确率与连贯性方面表现更优。
- 证明将信息增益与成本正则化相结合可实现更有效、更具策略性的提问生成。
提出的方法
- 使用深度强化学习训练一个提问生成器,以最大化预期正则化信息增益(RIG)并最小化提问成本。
- 提出一种新颖的奖励函数,平衡信息增益与提问成本,受理性言语行为框架启发。
- 采用基于 RIG 的损失函数,并引入偏度系数,以惩罚同义或冗余问题,引导模型走向最优策略。
- 训练一个端到端架构,包含提问生成器(QGen)、猜测者和真实答案提供者(oracle),以视觉特征和对话历史作为输入。
- 应用策略梯度优化提问生成策略,并通过消融实验对比 RIG 与标准信息增益及基线奖励函数。
- 使用 GuessWhat?! 数据集进行训练与评估,测试集包含新图像与新对象,以评估泛化能力。
实验结果
研究问题
- RQ1人工智能代理如何生成有效减少图像中对象不确定性的问题?
- RQ2人类在目标驱动的视觉探究中采用何种策略?这些策略能否被计算建模?
- RQ3结合提问成本建模的正则化信息增益能否提升视觉对话系统的连贯性与效率?
- RQ4与标准信息增益或基线奖励函数相比,基于 RIG 的训练在减少冗余问题方面表现如何?
- RQ5端到端强化学习结合 RIG 在多大程度上能实现类人战略行为的视觉提问生成?
主要发现
- 所提模型在 GuessWhat?! 数据集上实现了 67.19% 的新 SOTA 准确率,超越先前方法。
- 在新图像上,使用 RIG 作为奖励函数相比标准信息增益,准确率绝对提升 10.57%。
- 当 RIG 作为损失函数时,引入偏度系数可使性能最高提升 2.8%。
- 模型平均每轮对话仅生成 0.36 个重复问题,显著低于 Strub 等人(2017)基线模型的 0.82 个。
- 消融实验表明,仅使用信息增益不足以实现最优学习,但结合成本正则化的 RIG 可带来显著性能提升。
- 模型展现出策略性行为与问题序列间的相互一致性,避免冗余或无信息量的提问。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。