[论文解读] Learning and Leveraging Verifiers to Improve Planning Capabilities of Pre-trained Language Models
本文提出了一种用于微调大语言模型的验证器增强型规划框架,其中训练了一个独立的验证器模型来检测规划轨迹中的无效动作。通过使用来自同一数据集的随机采样负样本,验证器能够修剪非法动作,在Blocksworld规划任务中,成功率相比基线生成器提高了27%,无效转移率从52%降至5%。
There have been wide spread claims in the literature about the emergent reasoning capabilities of Pretrained Large Language Models. However, recent studies, have found that their ability to plan remains questionable. Through our experiments using GPT-2, we empirically demonstrate that the performance of a finetuned baseline remains poor because it violates pre-conditions of actions in the plans that it generates. To improve the planning capabilities of a finetuned LLM, we train a verifier, which can classify actions as being valid or invalid in a particular state. By randomly sampling actions from the same dataset, we generate examples of invalid actions which are then used to train a verifier which can check for action applicability. In the presence of diverse sampling from a generator and a verifier which can prune invalid trajectories, we show significant gains in the success rate on the Blocksworld domain. Additionally, we show that finetuning the GPT-2 generator itself to create the verifier generalizes better than finetuning the base GPT-2. Lastly, we investigate the role of the sampling temperature which can be used to control the exploration-exploitation tradeoff.
研究动机与目标
- 为解决微调大语言模型规划性能差的问题,这些模型常违反动作前提条件。
- 探究通过实时检测无效动作,学习到的验证器是否能提升规划质量。
- 探索是否微调生成器本身用于验证,相比使用基础大语言模型,泛化能力更强。
- 分析采样温度对规划生成中探索-利用权衡的影响。
- 评估验证器增强型生成是否在增加生成尝试次数时,相比基线模型具有更好的可扩展性。
提出的方法
- 通过从同一数据集中随机采样动作生成负样本,在成功轨迹数据集上训练验证器模型。
- 基于前提条件,使用验证器判断给定动作在给定状态下是否适用。
- 将验证器集成到生成-测试循环中:生成器采样多条轨迹,验证器过滤掉无效动作。
- 将生成器本身微调为验证器(V_generator),而非使用基础GPT-2模型(V_base),以提升泛化能力。
- 通过生成过程中的采样温度控制探索-利用平衡,对τ ∈ {0.2, 0.5, 0.8, 1.1}进行超参数搜索。
- 通过不同生成尝试次数(k ∈ {1, 8, 16, 25})下的目标达成率(GRR)和无效转移率(BTR)评估性能。

实验结果
研究问题
- RQ1在来自同一数据集的负样本上进行自监督训练的验证器,能否显著提升基于大语言模型的规划器的成功率?
- RQ2将生成器模型本身微调为验证器,是否比微调基础大语言模型具有更好的泛化能力?
- RQ3采样温度如何影响规划生成中探索与利用之间的平衡?
- RQ4验证器增强型生成器是否在增加生成尝试次数时,相比基线生成器具有更好的可扩展性?
- RQ5验证器在多大程度上降低了生成轨迹中无效动作的发生率?
主要发现
- 当有25次生成尝试时,带验证器的生成器相比基线生成器,目标达成率(GRR)提高了27%。
- 使用验证器后,无效转移率(无效动作)从基线的52%降至仅5%。
- 基线生成器在16次尝试后性能趋于平稳,而验证器增强型模型在更多尝试下仍持续提升。
- 将生成器本身微调为验证器(V_generator)得到的结果优于微调基础GPT-2模型(V_base),GRR分别为0.655和0.635。
- 采样温度对性能具有非单调影响,最优值约为τ = 0.8,表明探索与利用之间存在权衡。
- 基于验证器的方法在更多生成尝试下表现出一致的可扩展性,表明验证在可靠的大语言模型规划中至关重要。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。