Skip to main content
QUICK REVIEW

[论文解读] CraftAssist Instruction Parsing: Semantic Parsing for a Minecraft Assistant

Yacine Jernite, Kavya Srinet|arXiv (Cornell University)|Apr 17, 2019
Topic Modeling参考文献 29被引用 8
一句话总结

本文介绍了 CraftAssist,这是一个包含 35K 条人类生成的自然语言指令及其对应逻辑形式的大规模语义解析数据集,用于控制 Minecraft 中的智能体。通过结构化语法和众包重述,作者训练了神经模型,在模板生成的数据上取得了高准确率,但在自由形式的人类指令上面临显著的泛化挑战,凸显了指令解析系统在鲁棒性方面的需求。

ABSTRACT

We propose a large scale semantic parsing dataset focused on instruction-driven communication with an agent in Minecraft. We describe the data collection process which yields additional 35K human generated instructions with their semantic annotations. We report the performance of three baseline models and find that while a dataset of this size helps us train a usable instruction parser, it still poses interesting generalization challenges which we hope will help develop better and more robust models.

研究动机与目标

  • 开发一个可扩展、可复现的环境,用于在 Minecraft 作为仿真平台的前提下,训练和评估人机交互中的语义解析器。
  • 创建一个大规模、带注释的自然语言指令数据集,与可执行的逻辑形式配对,用于 Minecraft 助手。
  • 在分布内和分布外的指令数据上评估神经语义解析模型,识别在真实使用中出现的泛化差距。
  • 通过在游戏内提供可执行的逻辑形式代码,实现端到端的可复现性,支持完整流水线的验证。

提出的方法

  • 设计一种基于 Minecraft 原原子操作(如放置、移动、建造)的中层动作语法,以定义智能体动作的结构化逻辑形式。
  • 使用模板从语法生成合成的自然语言指令,然后通过众包收集重述版本,生成多样化的、类人的表达。
  • 收集一个独立的测试集,包含非模板生成的自由形式人类指令,并为其标注逻辑形式,以评估泛化能力。
  • 训练并评估三种神经语义解析模型:基础的 Seq2Tree 模型、带有循环上下文的 SentenceRec 模型,以及对 Dong 和 Lapata (2016) 模型的重新实现并适配到该语法。
  • 使用两层 GRU 编码器,结合 FastText 嵌入和可学习维度,应用标签平滑、dropout 和词 dropout 进行正则化。
  • 使用 Adagrad 优化器训练模型,并在验证准确率上采用早停策略,选择在重述验证数据上表现最佳的模型进行最终评估。

实验结果

研究问题

  • RQ1神经语义解析器能否从模板生成的训练数据泛化到复杂、开放式的环境(如 Minecraft)中的自由形式人类指令?
  • RQ2在训练数据与测试数据分布发生偏移时,不同模型架构(如循环与独立预测)的表现如何?
  • RQ3当解析涉及空间引用、对象类型和动作作用范围的自然语言指令时,模型会犯哪些错误?
  • RQ4模型在理解模糊引用(如 'the church'(示意图对象 vs. 参照对象)或 'mobs' 与 'objects')方面的能力如何?
  • RQ5动态可执行环境的引入如何影响语义解析模型的训练与评估?

主要发现

  • 所有模型在模板生成的训练数据上均达到接近 100% 的准确率,证实其能够有效逆向还原模板生成过程。
  • 表现最佳的模型 SentenceRec 在重述验证数据上达到 80.7% 的树级准确率,表明其在重述但分布内指令上的强大性能。
  • 在提示词(86% 的指令符合语法规则)上的表现显著下降,模型在从结构化模板到想象中的开放式指令的领域偏移中表现最差。
  • 模型在跨度节点和类别节点预测方面尤其困难,尤其是在识别位置或重复修饰语的作用范围时。
  • 将示意图对象(如 'a house')与参照对象(如 'the house')混淆的情况很常见,表明其在上下文理解方面存在挑战。
  • 最常见的错误类型是将实际存在的节点预测为非活动状态,尤其在跨度节点上,深度/高度混淆是一个显著的例外。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。