[论文解读] Neural Modular Control for Embodied Question Answering
该论文提出神经模块化控制(NMC),一种用于具身问答的分层强化学习框架,将复杂的导航任务分解为可解释的语义子目标(例如,'找到厨房'、'找到冰箱')。通过训练一个主策略来选择子目标,并使用模仿学习后接强化学习训练专门的子策略来执行这些子目标,NMC在EQA基准测试中实现了优于先前方法的导航与问答性能,显著提升了准确率和向目标前进的进度。
We present a modular approach for learning policies for navigation over long planning horizons from language input. Our hierarchical policy operates at multiple timescales, where the higher-level master policy proposes subgoals to be executed by specialized sub-policies. Our choice of subgoals is compositional and semantic, i.e. they can be sequentially combined in arbitrary orderings, and assume human-interpretable descriptions (e.g. 'exit room', 'find kitchen', 'find refrigerator', etc.). We use imitation learning to warm-start policies at each level of the hierarchy, dramatically increasing sample efficiency, followed by reinforcement learning. Independent reinforcement learning at each level of hierarchy enables sub-policies to adapt to consequences of their actions and recover from errors. Subsequent joint hierarchical training enables the master policy to adapt to the sub-policies. On the challenging EQA (Das et al., 2018) benchmark in House3D (Wu et al., 2018), requiring navigating diverse realistic indoor environments, our approach outperforms prior work by a significant margin, both in terms of navigation and question answering.
研究动机与目标
- 解决具身问答中长期视野、部分可观测及稀疏奖励的导航挑战。
- 通过将高层子目标规划与低层动作执行解耦,提升样本效率与训练稳定性。
- 通过使用语义上明确、人类可读的子目标,增强可解释性与错误恢复能力。
- 通过模块化、预训练的子策略,实现在多样化室内环境中的鲁棒泛化能力。
- 在EQA基准测试中,于导航效率与答案准确率两方面均超越现有模型。
提出的方法
- 该框架采用分层策略,主策略基于问题与视觉输入选择一系列语义子目标(例如,'离开房间'、'找到客厅')。
- 每个子目标由专门的神经子策略执行,该子策略首先通过行为克隆在专家轨迹上进行预训练,随后通过A3C强化学习进行错误恢复与适应。
- 子策略独立训练,可模块化地与主策略结合,支持预训练与迁移学习。
- 主策略通过探索子目标序列来优化长期视野导航与问答性能,利用模仿学习的密集监督与环境反馈的稀疏奖励进行训练。
- 主策略与子策略的联合训练使主策略能够适应子策略的行为,从而提升整体策略的鲁棒性。
- 模型使用固定的视觉编码器(例如,ResNet)与VQA头部,在到达目标物体后预测答案。
实验结果
研究问题
- RQ1具有组合性语义子目标的分层策略是否能提升长期具身问答任务中的样本效率与性能?
- RQ2在模块化层级中结合行为克隆与强化学习,是否能比端到端训练带来更好的泛化能力与错误恢复能力?
- RQ3在稀疏奖励环境中,能否通过在语义子目标空间中进行规划的主策略,超越直接预测原始动作的模型?
- RQ4该模型在House3D基准测试中对未见环境与初始位置的泛化能力如何?
- RQ5子目标序列的可解释性在多大程度上提升了模型的透明度与可调试性?
主要发现
- NMC(BC + A3C)在所有评估指标上均优于PACMAN与NMC(BC),在初始距离50米时达到58.7%的答案准确率,高于PACMAN的53.3%。
- 该模型在向目标前进方面表现更优,初始距离50米时平均dΔ为-5.28米,表明导航效率更高。
- 主策略在未见环境中具备合理的泛化能力,在验证集上与真实子目标序列的IoU达到约48%,尽管训练与验证环境无重叠。
- 与A3C微调联合训练显著提升性能,表明子策略能从动作反馈中获益,且主策略能适应子策略行为。
- 使用行为克隆进行预训练可降低样本复杂度,并在稀疏奖励设置下实现更快收敛。
- 模块化设计支持可解释推理:智能体在每一步的意图均以人类可读的子目标形式表达,例如'find object[sofa]'。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。