[论文解读] Source-Target Inference Models for Spatial Instruction Understanding
该论文提出了一种新颖的源-目标推理模型,用于空间指令理解,采用联合损失表示学习、卷积神经网络(CNN)和双注意力机制,并结合两种推理策略——基于期望的回归与通过策略梯度进行的退火采样。该模型在具有挑战性的空白标签积木数据集上实现了最先进性能,源积木准确率提升47%,目标位置平均距离降低22%。
Models that can execute natural language instructions for situated robotic tasks such as assembly and navigation have several useful applications in homes, offices, and remote scenarios. We study the semantics of spatially-referred configuration and arrangement instructions, based on the challenging Bisk-2016 blank-labeled block dataset. This task involves finding a source block and moving it to the target position (mentioned via a reference block and offset), where the blocks have no names or colors and are just referred to via spatial location features. We present novel models for the subtasks of source block classification and target position regression, based on joint-loss language and spatial-world representation learning, as well as CNN-based and dual attention models to compute the alignment between the world blocks and the instruction phrases. For target position prediction, we compare two inference approaches: annealed sampling via policy gradient versus expectation inference via supervised regression. Our models achieve the new state-of-the-art on this task, with an improvement of 47% on source block accuracy and 22% on target position distance.
研究动机与目标
- 为解决仅使用空间相对特征理解自由形式自然语言指令以进行机器人积木排列的挑战。
- 在无命名、无颜色或无标签积木的情况下,提升源积木选择与目标位置预测性能。
- 开发一种统一模型,通过有限监督联合学习语言与空间世界表征,覆盖多个子任务。
- 对比并优化两种推理策略——基于期望的回归与基于策略梯度的采样,用于目标位置预测。
- 通过注意力机制与集成学习提升在多样化但规模较小的数据集上的泛化能力与鲁棒性。
提出的方法
- 通过在源积木分类与目标位置回归之间共享损失函数,联合训练子任务,统一空间相对语义学习。
- 采用基于CNN和双注意力机制,通过双线性注意力矩阵将指令短语与积木的空间特征对齐。
- 实现两种推理策略:通过监督回归进行期望推理,以及通过带退火的策略梯度进行采样推理,用于参考积木选择。
- 在子任务间共享语言与世界表征参数,以提升数据效率与泛化能力。
- 应用集成方法与消融研究以识别最优配置,包括注意力类型与训练策略。
- 采用有效的平均积木退火程序以稳定策略梯度训练并提升采样性能。
实验结果
研究问题
- RQ1在有限监督下,跨源与目标子任务的联合表征学习在空间指令理解任务中如何提升性能?
- RQ2在积木排列任务中,基于期望的回归与基于采样的推理在目标位置预测方面相对有效性如何?
- RQ3基于CNN的注意力机制与双注意力机制在将语言短语与积木空间特征对齐方面表现如何比较?
- RQ4共享表征与联合优化在多样化但小规模的空白标签积木数据集上,对泛化能力的提升程度如何?
- RQ5是否可以通过互补使用多种注意力机制与推理策略,进一步增强模型的鲁棒性与准确性?
主要发现
- 与先前最先进方法相比,该模型在源积木选择准确率上提升了47%。
- 与先前工作相比,目标位置预测的平均距离降低了22%(即0.8个积木长度)。
- 基于CNN的注意力机制表现优于双注意力模型,但两者结合时具有互补性。
- 通过共享损失函数联合训练源与目标子任务,性能优于非联合训练。
- 基于期望的推理方法(通过监督回归)略优于基于采样的方法(通过策略梯度)。
- 该模型表现出强稳定性,源准确率的标准差仅为1%,目标平均距离的标准差为0.05个积木长度(基于8次运行)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。