[论文解读] Learning to Rank for Synthesizing Planning Heuristics
本文提出通过基于RankSVM的排序学习方法来学习规划启发式函数,该方法优化状态之间的相对顺序而非回归误差。它引入了捕捉近似计划中时间交互作用的成对动作特征,在IPC问题上相比基于回归的方法和标准启发式函数表现出更优性能,具有更高的覆盖度和更好的Kendall tau相关性。
We investigate learning heuristics for domain-specific planning. Prior work framed learning a heuristic as an ordinary regression problem. However, in a greedy best-first search, the ordering of states induced by a heuristic is more indicative of the resulting planner's performance than mean squared error. Thus, we instead frame learning a heuristic as a learning to rank problem which we solve using a RankSVM formulation. Additionally, we introduce new methods for computing features that capture temporal interactions in an approximate plan. Our experiments on recent International Planning Competition problems show that the RankSVM learned heuristics outperform both the original heuristics and heuristics learned through ordinary regression.
研究动机与目标
- 通过将启发式学习重新定义为排序问题而非回归问题,来改进领域特定的规划启发式函数。
- 开发能够编码近似计划中动作之间时间与顺序交互作用的特征。
- 证明基于排序的学习方法在规划器覆盖度和启发式质量方面优于基于回归的学习方法。
- 在国际规划竞赛(IPC)学习赛道的真实规划问题上评估该方法。
提出的方法
- 将启发式学习表述为使用RankSVM的排序学习问题,其中损失函数优化沿计划路径的状态相对顺序。
- 引入源自领域无关启发式函数(如CEA)生成的近似计划结构的成对动作特征。
- 利用CEA启发式生成的松弛计划提取捕捉动作顺序与交互模式的特征。
- 使用组合规划器生成的状态轨迹训练RankSVM模型,并通过正则化防止过拟合。
- 在问题规模方差较大的领域中对启发式函数施加非负性约束,以提升泛化能力。
- 通过覆盖度、平均计划长度、规划时间、扩展次数、RMSE和Kendall’s tau相关性来评估性能。
实验结果
研究问题
- RQ1将启发式学习视为排序问题是否能比视为回归问题带来更好的规划器性能?
- RQ2编码动作之间时间交互作用的特征是否能相比更简单的基于动作的特征提升启发式质量?
- RQ3基于RankSVM的启发式函数在IPC基准问题上的性能与标准启发式函数(如FF和CEA)相比如何?
- RQ4在贪心最佳优先搜索中,Kendall’s tau是否比RMSE更好地预测启发式质量?
- RQ5在相同领域中,基于小规模问题训练的启发式函数能否泛化到更大、未见过的问题?
主要发现
- 在所有领域中,基于RankSVM的启发式函数比原始的FF和CEA启发式函数解决了更多问题,尤其在transport和parking领域覆盖度有显著提升。
- 成对动作特征优于单个动作特征,尽管评估成本增加,但仍生成了更强的启发式函数。
- Kendall’s tau在各领域中与问题覆盖度呈正相关,而RMSE则无此关联,表明tau是更优的启发式质量度量指标。
- 非负性约束在transport领域(问题规模呈双峰分布)中提升了泛化能力,表明其在高方差环境下具有优势。
- 在no-mystery领域中,尽管tau值较高,但学习得到的启发式函数表现不佳,表明仅靠排序无法捕捉到无法到达目标(dead-ends)的问题,这是排序方法的局限性。
- FF RSVM Pair和CEA RSVM Pair启发式函数在elevators、transport和parking领域中解决了全部5个评估问题,但在no-mystery领域仅解决了1个,凸显了领域特异性挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。