Skip to main content
QUICK REVIEW

[論文レビュー] What Algorithms can Transformers Learn? A Study in Length Generalization

Hattie Zhou, Arwen Bradley|arXiv (Cornell University)|Oct 24, 2023
Topic Modeling被引用数 7
ひとこと要約

本論文は、RASP-Generalization 予想を提唱する。この予想は、タスクが短い RASP-L プログラムで解ける場合に限り、Transformer がアルゴリズム的タスクにおいて強い長さ一般化を示すと述べるものである。RASP-L は、Transformer のインダクティブバイアスと整合性を持つアルゴリズムを表現するための形式的言語である。この予想は、入力フォーマットを再構成して短い RASP-L 解を可能にすることで、かつて難易度の高かった問題(パリティや加算など)を含め、多様なタスクにおける長さ一般化をうまく予測する。これは、Transformer におけるアルゴリズム的学習を理解する包括的な枠組みを提供する。

ABSTRACT

Large language models exhibit surprising emergent generalization properties, yet also struggle on many simple reasoning tasks such as arithmetic and parity. This raises the question of if and when Transformer models can learn the true algorithm for solving a task. We study the scope of Transformers' abilities in the specific setting of length generalization on algorithmic tasks. Here, we propose a unifying framework to understand when and how Transformers can exhibit strong length generalization on a given task. Specifically, we leverage RASP (Weiss et al., 2021) -- a programming language designed for the computational model of a Transformer -- and introduce the RASP-Generalization Conjecture: Transformers tend to length generalize on a task if the task can be solved by a short RASP program which works for all input lengths. This simple conjecture remarkably captures most known instances of length generalization on algorithmic tasks. Moreover, we leverage our insights to drastically improve generalization performance on traditionally hard tasks (such as parity and addition). On the theoretical side, we give a simple example where the "min-degree-interpolator" model of learning from Abbe et al. (2023) does not correctly predict Transformers' out-of-distribution behavior, but our conjecture does. Overall, our work provides a novel perspective on the mechanisms of compositional generalization and the algorithmic capabilities of Transformers.

研究の動機と目的

  • Transformer が訓練分布外の長さ一般化を系統的に可能とする条件を理解すること。特に、アルゴリズム的タスクにおける長さ一般化に焦点を当てる。
  • Transformer が一部の推論タスクでは驚くべき成功を収める一方で、他のタスクでは失敗するという矛盾を解消すること。特に分布外一般化の観点から。
  • Transformer がパターンの記憶に依存するのではなく、真のアルゴリズムを学習する条件を予測できる包括的なフレームワークを構築すること。
  • アーキテクチャ的およびプロンプト工学的選択が、短い RASP-L プログラム表現を可能にすることで、強力な一般化を解き放つことができることを示すこと。
  • 形式的言語によるアルゴリズム的単純さの定式化に基づいて、Transformer におけるアルゴリズム的推論の理論的・実証的基盤を提供すること。

提案手法

  • 著者らは、Transformer が学びやすいシンプルで自然なアルゴリズムを表現できるように設計された、RASP プログラミング言語の制限付きサブセットである RASP-L を導入する。
  • 「表現に適した単純さ」を、短い RASP-L プログラムによる表現可能性として定義し、RASP-Generalization 予想の根拠を形成する。
  • 予想は、タスクが短い RASP-L 解を許容する場合に限り、Transformer が長さ一般化を示すと述べるものであり、多様なアルゴリズム的タスクで検証されている。
  • 従来は解けないと思われていたタスク(例:パリティ、加算)を、短い RASP-L プログラムが可能になるように入力およびスクラッチパッドのフォーマットを再構成し、強力な一般化を実現している。
  • 訓練中に観測したあらゆる長さよりも長いテストシーケンスでの一般化性能を評価し、+10 の長さでの正確一致精度を測定している。
  • 既存の理論モデル(例:最小次数補間子)と比較し、Abbe ら(2023)のモデルが失敗するケースでも、本研究のフレームワークが正しく行動を予測することを示している。

実験結果

リサーチクエスチョン

  • RQ1Transformer がアルゴリズム的タスクにおいて強い長さ一般化を示す条件は何か?
  • RQ2形式的言語を用いて、タスクが訓練分布外に一般化するかどうかを予測できるか?
  • RQ3同じモデルアーキテクチャであっても、なぜ一部のアルゴリズム的タスクは一般化するのに対し、他のタスクは失敗するのか?
  • RQ4入力およびスクラッチパッド表現の再フォーマットによって、かつて困難視されていたタスク(例:パリティ、加算)の一般化が可能になるか?
  • RQ5RASP-Generalization 予想は、Transformer のインダクティブバイアスに関する既存の理論モデルとどのように比較されるか?

主な発見

  • 短い RASP-L プログラムが可能であるタスクはすべて強力な長さ一般化を示し、逆にそのようなプログラムが存在しないタスクは一般化しない。これは RASP-Generalization 予想を支持する。
  • かつて長さ一般化が不可能とされていたパリティおよび加算タスクにおいて、再構成されたフォーマットにより短い RASP-L 解が可能となり、訓練時よりも10桁長い入力でも100%の正確一致精度を達成した。
  • 長さ60以上のシーケンスで訓練されたモデルは、カウンティングタスクにおいて長さ150までほぼ完璧な長さ一般化を示し、分布シフトに対して強い耐性を示した。
  • Abbe ら(2023)の最小次数補間子モデルが失敗するケースでも、RASP-Generalization 予想は正しく一般化行動を予測しており、より正確なインダクティブバイアスの特徴付けであることが示された。
  • 本予想は、コピー、ソート、モード、加算といった多様なタスクにおける長さ一般化の事例を統一的に説明でき、一元的な予測フレームワークを提供する。
  • 本研究は、タスクが短い RASP-L 表現を許容する場合に、Transformer が真のアルゴリズムを学習できることを明らかにした。これは、それらが単に類似パターンの照合に依存しているという見解に挑戦するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。