Skip to main content
QUICK REVIEW

[论文解读] Structured, flexible, and robust: benchmarking and improving large language models towards more human-like behavior in out-of-distribution reasoning tasks

Katherine M. Collins, Catherine Wong|arXiv (Cornell University)|May 11, 2022
Topic Modeling被引用 14
一句话总结

本文提出了一项新的基准,用于评估大语言模型(LLMs)在分布外推理任务中的表现,结果表明人类在规划和解释生成任务中显著优于LLMs。本文提出了一种混合的解析-求解(Parse-and-Solve)模型,该模型利用LLM将自然语言解析为结构化的符号程序,再由符号规划器求解——与纯LLM相比,该模型在具有挑战性的、分布外的问题上展现出更高的鲁棒性和性能。

ABSTRACT

Human language offers a powerful window into our thoughts -- we tell stories, give explanations, and express our beliefs and goals through words. Abundant evidence also suggests that language plays a developmental role in structuring our learning. Here, we ask: how much of human-like thinking can be captured by learning statistical patterns in language alone? We first contribute a new challenge benchmark for comparing humans and distributional large language models (LLMs). Our benchmark contains two problem-solving domains (planning and explanation generation) and is designed to require generalization to new, out-of-distribution problems expressed in language. We find that humans are far more robust than LLMs on this benchmark. Next, we propose a hybrid Parse-and-Solve model, which augments distributional LLMs with a structured symbolic reasoning module. We find that this model shows more robust adaptation to out-of-distribution planning problems, demonstrating the promise of hybrid AI models for more human-like reasoning.

研究动机与目标

  • 评估大语言模型(LLMs)在分布外推理任务中相对于人类的泛化能力。
  • 开发一个基准,用于衡量超越模式检索的灵活、创造性的基于语言的推理能力。
  • 提出并评估一种结合分布语言建模与符号推理的混合模型,以提升鲁棒性。
  • 探究结构化符号推理是否能提升LLM在新颖、受限推理问题上的表现。
  • 探讨仅靠语言建模在多大程度上能够捕捉人类推理的底层认知计算过程。

提出的方法

  • 该基准采用迭代约束生成范式,生成新颖的、分布外的推理提示,以减少对常见语言模式的依赖。
  • 在三种条件下收集人类响应:基线条件,以及两个逐步受限的条件,以激发创造性和非常规的响应。
  • 提出一种解析-求解(P+S)模型,其中LLM使用一种合成语法将自然语言提示映射为形式化、可执行的程序。
  • 符号求解器组件通过在受限动作空间上使用基于搜索的规划器来执行这些程序,生成有效计划。
  • 通过测量在不同约束水平下计划的准确率和鲁棒性,比较P+S模型与纯LLM作为规划器的基线模型的性能。
  • 使用统计建模(LMER)比较不同约束条件下各模型的性能与鲁棒性。

实验结果

研究问题

  • RQ1大语言模型在多大程度上能泛化到分布外推理任务,相较于人类?
  • RQ2迭代约束生成是否能有效激发新颖、创造性的推理响应,从而避免常见语言模式?
  • RQ3一种将语言映射为结构化符号程序的混合模型,是否能提升在具有挑战性的、受限推理问题上的鲁棒性?
  • RQ4由LLM解析程序引导的符号规划器,在分布外设置下的表现,与端到端LLM规划相比如何?
  • RQ5仅靠分布语言建模在多大程度上无法捕捉人类类推理的结构?

主要发现

  • 人类在该基准测试中显著优于LLMs,尤其是在最受限的条件下,表明LLMs在分布外推理方面存在困难。
  • LLM作为规划器的基线模型在最受限条件下未能解决任何问题,凸显其在新颖约束下的脆弱性。
  • 解析-求解模型在整体性能上显著优于LLM作为规划器的基线模型(p < 0.001)。
  • 两种模型在不同条件下的性能下降趋势相似,表明解析组件也可能难以泛化到高度组合性或新颖的目标。
  • 该混合模型对约束表现出更强的鲁棒性,表明符号推理接口可提升对新颖推理场景的适应能力。
  • 结果表明,仅靠分布语言建模无法充分捕捉人类推理的完整结构,尤其是在新颖或复杂情境下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。