Skip to main content
QUICK REVIEW

[论文解读] What Algorithms can Transformers Learn? A Study in Length Generalization

Hattie Zhou, Arwen Bradley|arXiv (Cornell University)|Oct 24, 2023
Topic Modeling被引用 7
一句话总结

本文提出了RASP-Generalization猜想,该猜想认为:当且仅当任务能通过简短的RASP-L程序解决时,Transformers在算法任务上才会表现出强大的长度泛化能力——RASP-L是一种与Transformers归纳偏置兼容的形式化语言,用于表达算法。该猜想成功预测了多种任务中的长度泛化表现,包括此前被认为困难的问题(如奇偶性检测和加法),只要对输入格式进行重构以支持简洁的RASP-L解决方案,从而为理解Transformers中的算法学习提供了一个统一框架。

ABSTRACT

Large language models exhibit surprising emergent generalization properties, yet also struggle on many simple reasoning tasks such as arithmetic and parity. This raises the question of if and when Transformer models can learn the true algorithm for solving a task. We study the scope of Transformers' abilities in the specific setting of length generalization on algorithmic tasks. Here, we propose a unifying framework to understand when and how Transformers can exhibit strong length generalization on a given task. Specifically, we leverage RASP (Weiss et al., 2021) -- a programming language designed for the computational model of a Transformer -- and introduce the RASP-Generalization Conjecture: Transformers tend to length generalize on a task if the task can be solved by a short RASP program which works for all input lengths. This simple conjecture remarkably captures most known instances of length generalization on algorithmic tasks. Moreover, we leverage our insights to drastically improve generalization performance on traditionally hard tasks (such as parity and addition). On the theoretical side, we give a simple example where the "min-degree-interpolator" model of learning from Abbe et al. (2023) does not correctly predict Transformers' out-of-distribution behavior, but our conjecture does. Overall, our work provides a novel perspective on the mechanisms of compositional generalization and the algorithmic capabilities of Transformers.

研究动机与目标

  • 理解Transformers在何种条件下能够系统性地超越其训练分布进行泛化,特别是在算法任务上的长度泛化。
  • 解决Transformers在某些推理任务中表现惊人成功,而在其他任务中却失败的矛盾,尤其是在分布外泛化方面。
  • 构建一个统一框架,以预测Transformers何时以及为何学习真正的算法而非仅记忆模式。
  • 证明通过架构设计和提示工程的选择,可以解锁强泛化能力,方法是使简洁的RASP-L程序表示成为可能。
  • 为Transformers中的算法推理提供理论与实证基础,其核心是基于算法简洁性的形式化语言。

提出的方法

  • 作者引入了RASP-L,即RASP编程语言的一个受限子集,旨在表达对Transformers而言简单且自然的算法。
  • 他们将“易于表示”定义为可通过简短的RASP-L程序表达,这构成了RASP-Generalization猜想的基础。
  • 该猜想指出:Transformers仅在任务存在简短RASP-L解决方案时才会实现长度泛化,该猜想已在多种算法任务中得到验证。
  • 作者通过重构输入和思维链(scratchpad)格式,使此前难以处理的任务(如奇偶性、加法)能够被简短的RASP-L程序解决,从而实现强泛化。
  • 他们在测试序列长度超过训练中任何序列的条件下评估泛化性能,测量在+10长度下的精确匹配准确率。
  • 他们将该猜想与现有理论模型(如最小次数插值器)进行对比,表明其框架在先前模型失败的场景中仍能正确预测行为。

实验结果

研究问题

  • RQ1在何种条件下,Transformers会在算法任务上表现出强大的长度泛化?
  • RQ2能否使用一种形式化语言来预测任务在Transformers中是否能超越训练分布进行泛化?
  • RQ3为何某些算法任务能泛化而另一些则不能,尽管模型架构相似?
  • RQ4重新格式化输入和思维链表示是否能解锁传统上困难任务(如奇偶性与加法)的泛化能力?
  • RQ5RASP-Generalization猜想与现有Transformer归纳偏置理论模型相比如何?

主要发现

  • 所有能被简短RASP-L程序表达的任务均表现出强长度泛化,而无法用此类程序表达的任务则不具泛化能力,支持RASP-Generalization猜想。
  • 奇偶性与加法任务在以往被认为难以实现长度泛化,但在格式重构后,其在比训练长度多10位的输入上实现了100%的精确匹配准确率。
  • 在长度60或更长的序列上进行训练的模型,在计数任务上对长度达150的序列也表现出近乎完美的长度泛化,显示出对分布偏移的鲁棒性。
  • RASP-Generalization猜想在Abbe等人(2023)提出的最小次数插值器模型失败的场景中仍能正确预测泛化行为,表明其对归纳偏置的刻画更为准确。
  • 该猜想统一了包括复制、排序、众数和加法在内的多种任务中的长度泛化现象,提供了一个单一的预测框架。
  • 本研究揭示,当底层任务能以简洁的RASP-L形式表达时,Transformers能够学习真正的算法,从而挑战了其仅依赖类比模式匹配的既有观点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。