Skip to main content
QUICK REVIEW

[论文解读] Photo-Realistic Blocksworld Dataset

Masataro Asai|arXiv (Cornell University)|Dec 5, 2018
Multimodal Machine Learning Applications参考文献 19被引用 4
一句话总结

本文提出了一种照片级真实感的积木世界(Blocksworld)数据集生成器,可生成视觉复杂、逼真的积木堆叠环境图像,作为神经符号人工智能系统评估的基准。该系统利用变分自编码器(VAE)从原始图像中学习符号化状态表征,使经典规划器能够通过完整、系统的搜索解决任务;Latplan 在 30 个测试实例中成功解决了 14 个,尽管在复杂视觉条件下存在重建误差,但仍证明了其可行性。

ABSTRACT

In this report, we introduce an artificial dataset generator for Photo-realistic Blocksworld domain. Blocksworld is one of the oldest high-level task planning domain that is well defined but contains sufficient complexity, e.g., the conflicting subgoals and the decomposability into subproblems. We aim to make this dataset a benchmark for Neural-Symbolic integrated systems and accelerate the research in this area. The key advantage of such systems is the ability to obtain a symbolic model from the real-world input and perform a fast, systematic, complete algorithm for symbolic reasoning, without any supervision and the reward signal from the environment.

研究动机与目标

  • 创建一个视觉逼真、照片级真实感的积木世界规划领域数据集,以加速神经符号融合研究。
  • 实现在无监督或奖励信号的情况下,从原始视觉输入端到端学习符号化状态表征。
  • 提供一个基准,用于评估神经网络从复杂、逼真的图像中重建符号化规划状态的能力。
  • 测试将深度学习与经典符号规划相结合,在视觉化、高层级任务规划场景中的可行性。
  • 将 Atari 学习环境范式扩展至经典规划领域,引入视觉真实感与组合性子目标交互。

提出的方法

  • 使用修改后的积木世界环境,结合照片级真实感纹理与光照,渲染出逼真的三维积木配置场景。
  • 在 2,500 个随机采样的状态上训练变分自编码器(VAE),以学习视觉输入的紧凑且解耦的潜在表征。
  • 将学习到的 VAE 嵌入作为输入,输入至经典规划器(Fast Downward)中,使用盲启发式方法评估规划可行性。
  • 利用 AMA 1 PDDL 生成器验证 VAE 学习到的状态表征是否与搜索空间中的真实状态节点一致。
  • 通过从随机初始状态出发的 3、7 或 14 步随机游走生成规划实例,以创建多样化的目标配置。
  • 将神经符号规划器(Latplan)应用于重构的表征,以测试解的质量与完备性。

实验结果

研究问题

  • RQ1深度自编码器能否从积木世界环境的照片级真实感图像中,以足够高的准确度学习到符号化状态表征,以支持经典规划?
  • RQ2视觉复杂性与真实感在多大程度上会阻碍 VAE 重建出在语义上与底层 PDDL 逻辑一致的状态?
  • RQ3仅使用 VAE 学习到的表征作为输入,经典规划器能否在无奖励信号或动作标签的情况下,找到正确且完整的解?
  • RQ4随着视觉噪声与环境变化的增加,神经符号系统的性能会如何退化?
  • RQ5视觉领域中子目标冲突(如 Sussman 异常)的存在是否会影响表征学习与规划的可靠性?

主要发现

  • 基于 VAE 的表征学习方法使 Latplan 系统在 30 个测试实例中成功生成了 14 个正确规划,证明了端到端视觉规划的初步成功。
  • 系统在 16 个实例上失败,主要由于 VAE 在视觉复杂条件下的状态重建错误,表明在表示准确性方面存在局限。
  • 四块积木、三堆的环境其搜索空间包含 5,760 个状态与 34,560 条转移,为表征学习提供了非平凡的基准。
  • 在 Fast Downward 中使用盲启发式方法避免了完整启发式计算带来的可扩展性问题,使研究重点集中于表征保真度而非规划效率。
  • 结果表明,当前自编码器在应对视觉积木世界的组合与空间推理需求方面仍显不足,尤其在子目标交互存在时更为明显。
  • 该数据集生成器已公开发布于 https://github.com/ibm/photorealistic-blocksworld,支持可复现性与未来基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。