[论文解读] RMM: A Recursive Mental Model for Dialog Navigation
本文提出了递归心理模型(RMM),这是一种用于视觉-语言任务中端到端对话导航的新颖框架,其中导航代理与引导代理通过递归自我建模联合学习生成问题、答案和导航动作。RMM通过使用目标进展作为奖励的强化学习,提升了在未见过环境中的泛化能力,在对话连贯性和导航成功率方面优于基线模型。
Language-guided robots must be able to both ask humans questions and understand answers. Much existing work focuses only on the latter. In this paper, we go beyond instruction following and introduce a two-agent task where one agent navigates and asks questions that a second, guiding agent answers. Inspired by theory of mind, we propose the Recursive Mental Model (RMM). The navigating agent models the guiding agent to simulate answers given candidate generated questions. The guiding agent in turn models the navigating agent to simulate navigation steps it would take to generate answers. We use the progress agents make towards the goal as a reinforcement learning reward signal to directly inform not only navigation actions, but also both question and answer generation. We demonstrate that RMM enables better generalization to novel environments. Interlocutor modelling may be a way forward for human-agent dialogue where robots need to both ask and answer questions.
研究动机与目标
- 解决视觉-语言导航中端到端多轮对话的挑战,其中智能体需联合生成问题、答案和导航动作。
- 通过在协作的双智能体框架中建模问题生成与回答,克服现有研究仅关注指令遵循或单轮交互的局限性。
- 通过递归建模对话伙伴以模拟对话结果,提升对新环境的泛化能力。
- 利用以目标进展为奖励信号的强化学习,使智能体能够推理其对话行为对导航进展的影响。
- 证明受心智理论启发的递归心理建模可产生比简单数据增强或最优基线更连贯、更有效的对话。
提出的方法
- 提出递归心理模型(RMM),其中导航智能体递归模拟自身行为,以建模其问题将如何被引导智能体回答。
- 引导智能体同样模拟导航智能体的行为,以预测在潜在回答下可能采取的导航步骤。
- 使用带有递归自注意力机制的共享策略网络,以建模对话伙伴的响应和动作,实现对话与导航轨迹的联合规划。
- 通过强化学习端到端训练两个智能体,以目标进展(距离目标的距离)为主要奖励信号,同时优化导航、问题生成和答案生成。
- 采用固定启发式方法确定提问时机(每N步后提问),以解耦提问决策与生成过程,重点聚焦于C2、C3和C4。
- 在所有模型中使用单一采样器和初始化方式,确保对话质量差异源于架构与训练方式,而非生成超参数。
实验结果
研究问题
- RQ1递归自我建模能否在双智能体视觉-语言导航任务中提升对话连贯性与导航性能?
- RQ2与数据增强和最优基线相比,RMM在对话质量与未见环境泛化能力方面表现如何?
- RQ3建模对话伙伴心理状态在多大程度上提升了智能体生成有效问题与答案的能力?
- RQ4以目标进展为奖励信号的强化学习能否有效优化联合问题生成、答案生成与导航?
- RQ5与非递归或单智能体方法相比,对话结果的递归建模是否能带来更好的零样本测试环境泛化能力?
主要发现
- RMM智能体在无需使用长度惩罚或解码技巧的情况下,生成的对话比数据增强基线更连贯且更详细。
- 在未见过的环境中,RMM在新布局和目标物体位置的泛化能力更优,尤其能更好避免被非目标物体分心。
- 在提问时刻,RMM模型的目标进展(8.8)显著高于数据增强基线(5.7),表明其对话更有效地引导导航。
- 轨迹分析显示,RMM智能体更少出现卡住或不必要地重复行走的情况,相比基线更优。
- CVDN数据集中人工标注的对话表明,RMM生成的对话比数据增强方法更具上下文相关性与语义丰富性。
- 递归自我建模机制使智能体能够在执行前模拟对话行为的后果,从而实现更高效、更有效的导航。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。