[论文解读] Interactive Reinforcement Learning for Object Grounding via Self-Talking
本文提出了一种用于对话中视觉对象定位的交互式强化学习(IRL)框架,其中问题生成器、回答模型和猜测者通过共享的奖励函数进行联合训练。该方法显著提升了任务成功率——在GuessWhat?!基准上达到82.9%——同时通过奖励工程缓解了语言漂移问题,并增强了生成对话的可解释性。
Humans are able to identify a referred visual object in a complex scene via a few rounds of natural language communications. Success communication requires both parties to engage and learn to adapt for each other. In this paper, we introduce an interactive training method to improve the natural language conversation system for a visual grounding task. During interactive training, both agents are reinforced by the guidance from a common reward function. The parametrized reward function also cooperatively updates itself via interactions, and contribute to accomplishing the task. We evaluate the method on GuessWhat?! visual grounding task, and significantly improve the task success rate. However, we observe language drifting problem during training and propose to use reward engineering to improve the interpretability for the generated conversations. Our result also indicates evaluating goal-ended visual conversation tasks require semantic relevant metrics beyond task success rate.
研究动机与目标
- 开发一种更互动、更协作的视觉定位对话训练框架,其中所有智能体(问题生成器、回答模型、猜测者)均被联合优化。
- 解决先前方法仅微调问题生成器而保持其他模型固定的局限性。
- 缓解交互式强化学习过程中出现的语言漂移问题——即生成的对话变得难以理解。
- 通过奖励工程在不牺牲任务成功率的前提下提升生成对话的可解释性。
- 证明仅依赖任务成功率不足以评估目标导向型视觉对话系统,语义质量指标至关重要。
提出的方法
- 通过强化学习在动态环境中,使用共享奖励函数联合训练问题生成器、回答模型和猜测者。
- 采用参数化猜测者模型作为奖励函数,其在训练过程中动态更新,以适应其他智能体策略的演变。
- 为问题生成器实现一个带有全局点积注意力机制的序列到序列(seq2seq)模型,以增强对话中的长距离推理能力。
- 通过启发式剪枝进行奖励工程:移除包含重复短语或近似重复序列的问题,以强化自然语言模式。
- 推理阶段使用多项式采样,并使用Adam优化器进行微调(初始初始值学习率1e-4,批量大小64)。
- 在强化学习微调前对模型进行监督式预训练,以稳定训练过程并达到可比的基线性能。
实验结果
研究问题
- RQ1与先前方法相比,联合训练所有三个智能体(问题生成器、回答模型、猜测者)的交互式强化学习是否能显著提升视觉定位中的任务成功率?
- RQ2在交互式训练过程中,语言漂移在多大程度上出现,它如何影响生成对话的可解释性?
- RQ3通过剪枝不自然或冗余对话回合的奖励工程技术,能否提升生成对话的可读性和语义质量?
- RQ4仅任务成功率是否足以评估目标导向型视觉对话系统,还是需要额外的语义指标?
- RQ5与仅训练问题生成器相比,联合训练回答模型和猜测者如何影响生成回答的质量与一致性?
主要发现
- 所提出的IRL QAG模型在GuessWhat?!基准上实现了82.9%的任务成功率,显著优于先前最佳结果60.3%,并接近人类水平表现(84.4%)。
- IRL QAG模型表现出严重的语言漂移,59.0%的人工标注回答被判断与人类判断不一致,表明AI生成语言与自然语言之间存在语义鸿沟。
- 通过剪枝的奖励工程(IRL-prune QAG)提升了问题的可解释性,将平均问题质量排名从4.98提升至3.53,尽管任务成功率略有下降(81.3%)。
- IRL QAG中的回答模型即使在应答为“是”或“否”更合适时,也生成更多“n/a”响应,表明因语言漂移导致回答质量下降。
- 联合训练回答模型和猜测者(IRL AG)相比仅训练问题生成器,显著提升了回答质量,表明问题与回答策略之间实现了更好的对齐。
- 人工评估确认,采用交互式强化学习训练的模型生成的对话可解释性低于自然语言,凸显了在任务成功率之外引入语义评估的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。