[论文解读] Modularity Improves Out-of-Domain Instruction Following.
本文提出一种模块化架构,通过将任务分解为子目标类型,实现对自然语言指令的遵循。通过学习对指令进行分割并预测子目标类型,该模型在 ALFRED 基准测试中相较于标准序列到序列模型,显著提升了对分布外环境和新任务的零样本泛化能力。
We propose a modular architecture for following natural language instructions that describe sequences of diverse subgoals, such as navigating to landmarks or picking up objects. Standard, non-modular, architectures used in instruction following do not exploit subgoal compositionality and often struggle on out-of-distribution tasks and environments. In our approach, subgoal modules each carry out natural language instructions for a specific subgoal type. A sequence of modules to execute is chosen by learning to segment the instructions and predicting a subgoal type for each segment. When compared to standard sequence-to-sequence approaches on ALFRED, a challenging instruction following benchmark, we find that modularization improves generalization to environments unseen in training and to novel tasks.
研究动机与目标
- 解决非模块化指令遵循模型在未见环境和新任务上的泛化能力差的问题。
- 通过将自然语言指令分解为可重用的子目标类型,利用其组合结构。
- 通过学习对指令进行分割并预测子目标类型,提升指令遵循任务的零样本泛化能力。
- 证明模块化架构在 ALFRED 基准测试中对分布外任务的表现优于标准序列到序列模型。
提出的方法
- 该模型采用模块化架构,每个子目标类型(例如,导航至地标、拿起物体)由专用神经模块处理。
- 通过分割头将输入指令分割为子目标段。
- 子目标类型预测器为每个分割后的指令段分配特定的子目标类型。
- 每个子目标模块使用其自身的策略执行对应任务,实现组合式执行。
- 系统通过端到端学习在 ALFRED 基准测试上优化指令遵循性能。
- 模块化设计使得模型在未见环境和新任务组合中具备更强的零样本迁移能力。
实验结果
研究问题
- RQ1模块化架构能否提升指令遵循任务在分布外环境中的泛化能力?
- RQ2自然语言指令中的子目标组合性是否能提升对新任务的零样本迁移能力?
- RQ3在分布外性能方面,模块化指令遵循与标准序列到序列模型相比表现如何?
- RQ4学习对指令进行分割并预测子目标类型是否能带来优于端到端建模的泛化能力?
- RQ5模块化在多大程度上增强了对未见环境和任务组合的迁移能力?
主要发现
- 与标准序列到序列模型相比,模块化架构在训练期间未见过的环境中实现了更优的泛化能力。
- 该模型能有效泛化到训练期间未见过的子目标组合方式的新任务。
- 在 ALFRED 基准测试中,对分布外环境的零样本评估中观察到性能提升。
- 该方法利用了子目标组合性,实现了优于非模块化替代方案的迁移能力。
- 分割和子目标类型预测是使模型能够泛化到多样化指令类型的关键组件。
- 模块化设计在复杂、未见环境中实现了更鲁棒且可解释的指令遵循能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。