Skip to main content
QUICK REVIEW

[论文解读] Towards learning domain-independent planning heuristics

Paweł Gomoluch, Dalal Alrajeh|arXiv (Cornell University)|Jul 21, 2017
AI-based Problem Solving and Planning参考文献 1被引用 4
一句话总结

本文提出一种基于机器学习的方法,利用人工神经网络(ANN)学习领域无关的规划启发式函数,训练数据来自多种无关的规划领域。尽管整体性能未超越最先进启发式方法,但基于神经网络的快速前向启发式修正方法(NN-FF)在较简单的停车问题上将探索的状态数减少了3.5倍,显示出在特定问题子集上实现针对性改进的潜力。

ABSTRACT

Automated planning remains one of the most general paradigms in Artificial Intelligence, providing means of solving problems coming from a wide variety of domains. One of the key factors restricting the applicability of planning is its computational complexity resulting from exponentially large search spaces. Heuristic approaches are necessary to solve all but the simplest problems. In this work, we explore the possibility of obtaining domain-independent heuristic functions using machine learning. This is a part of a wider research program whose objective is to improve practical applicability of planning in systems for which the planning domains evolve at run time. The challenge is therefore the learning of (corrections of) domain-independent heuristics that can be reused across different planning domains.

研究动机与目标

  • 探究机器学习是否能够自动学习适用于多种规划领域的领域无关启发式函数。
  • 解决现有领域特定学习方法在动态或演化系统中应用时的局限性,即在领域事先未知的情况下。
  • 开发一种方法,通过共享的、领域无关的规划状态表示,实现在无关规划领域间的泛化。
  • 评估神经网络是否能够学习有效的启发式修正,以提升前向规划中的搜索效率。
  • 探索利用高质量但非最优的启发式规划器解作为训练数据,实现可扩展学习的可行性。

提出的方法

  • 在来自多种不同领域的小型规划问题最优解中提取的状态特征上训练人工神经网络。
  • 使用源自快速前向(FF)和成本有效A*(CEA)启发式函数的特征作为神经网络的输入表示。
  • 学习一个启发式函数,用于预测到达目标的代价,可从零开始学习,或作为对现有启发式函数(如FF)的修正。
  • 将训练好的神经网络作为启发式函数集成到前向搜索规划器中,以指导状态选择。
  • 通过比较在固定时间限制内探索的状态数和求解的问题数来评估性能。
  • 扩展数据收集范围,包括启发式规划器在长时间超时下产生的高质量非最优解,以实现对更大规模问题的扩展。

实验结果

研究问题

  • RQ1神经网络能否学习出在无关规划领域间具有良好泛化能力的领域无关启发式函数?
  • RQ2通过神经网络学习对现有领域无关启发式函数(如FF)进行修正,是否比从零开始学习性能更优?
  • RQ3所学习的神经网络启发式函数与FF和CEA等成熟领域无关启发式函数相比,性能如何?
  • RQ4神经网络启发式函数在特定问题子集(尤其是较简单的问题)上,对搜索效率的提升程度如何?
  • RQ5启发式规划器产生的噪声较大、非最优的解,能否有效用于训练可泛化的启发式函数以应对更大规模问题?

主要发现

  • 基于神经网络的快速前向启发式修正方法(NN-FF)在前10个停车问题上,相比FF平均将生成的状态数减少了3.5倍(使用几何平均)。
  • 尽管在较简单问题上表现显著提升,NN-FF在Transport领域仅比FF多解决了两个问题,在Woodworking领域则少解决了三个问题,表明整体性能提升有限。
  • 平均而言,NN-FF在所有领域中并未超越原始FF启发式函数,性能增益集中于特定的、较简单的问题实例。
  • 从零开始训练的神经网络启发式函数(NN)性能与目标计数等简单基线方法相当或更差,表明其在很大程度上复现了目标计数启发式函数。
  • 使用岭回归(RR-FF)和神经网络(NN-FF)对FF进行修正,均优于其各自独立模型(RR和NN),表明利用已有启发式函数可提升学习效果。
  • NN-FF在更难问题上的性能相对下降,表明在训练数据中引入更大规模的非最优解可能是实现更广泛性能提升的必要条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。