[論文レビュー] Limitations of Language Models in Arithmetic and Symbolic Induction
この論文は、大規模言語モデル(LLMs)が、算術加算、コピー、シーケンスの反転といった記号的変換タスクにおいて、分布外(OOD)設定や高頻度繰り返し条件下でなぜ失敗するかを調査する。特に、繰り返しの多い記号や長大なシーケンスを扱う際の限界に注目し、明示的な推論デモを用いて段階的に学習を進める新しい手法「LMs with tutor」を提案。この手法により、標準的なLLMsが失敗するOODおよび繰り返し入力でも100%の正確性を達成した。
Recent work has shown that large pretrained Language Models (LMs) can not only perform remarkably well on a range of Natural Language Processing (NLP) tasks but also start improving on reasoning tasks such as arithmetic induction, symbolic manipulation, and commonsense reasoning with increasing size of models. However, it is still unclear what the underlying capabilities of these LMs are. Surprisingly, we find that these models have limitations on certain basic symbolic manipulation tasks such as copy, reverse, and addition. When the total number of symbols or repeating symbols increases, the model performance drops quickly. We investigate the potential causes behind this phenomenon and examine a set of possible methods, including explicit positional markers, fine-grained computation steps, and LMs with callable programs. Experimental results show that none of these techniques can solve the simplest addition induction problem completely. In the end, we introduce LMs with tutor, which demonstrates every single step of teaching. LMs with tutor is able to deliver 100% accuracy in situations of OOD and repeating symbols, shedding new insights on the boundary of large LMs in induction.
研究の動機と目的
- 大規模言語モデル(LLMs)が、コピー、反転、加算といった基本的な記号的変換タスクで、特に分布外(OOD)または高頻度繰り返し条件下でなぜ失敗するかを調査すること。
- 失敗の根本的原因を特定すること、特に繰り返しの多い記号の処理や生成過程における位置認識の難しさに焦点を当てる。
- 微細な計算ステップ、位置マーカー、実行可能なプログラムといった既存の緩和戦略が、LLMsの記号的誘導タスクにおける一般化性能をどのように向上させるかを評価すること。
- 構造的で段階的な指導を用いる新しい手法「LMs with tutor」を提案・検証し、OODおよび繰り返しの多い記号的誘導タスクで、きめ細やかで100%の正確性を達成することを目的とする。
提案手法
- 『LMs with tutor』——15例の段階的推論デモを含むプロンプトを用いる訓練および推論パラダイム——を導入。各操作(例:移動、コピー、反転)を構造的・原子的(atomic)に示す。
- 人間が読みやすい明示的推論ステップ(例:「アイテム1を位置3に移動」)を用い、モデルが記号的演算を段階的に処理できるように指導。これはチューターの指導的役割を模倣する。
- 入力と中間ステップを含むプロンプト形式を採用。変換中にアイテムの位置を追跡するため、'rmov'(逆方向移動)や'lmov'(左移動)といった操作を用いる。
- 標準的Few-shotプロンプト、微細なステップ、位置マーカー(暗黙的または明示的)、実行可能なプログラムを、加算、コピー、反転の複数のタスクで比較。
- モデルを分布内データ(最大5個のアイテムまたは数字)で訓練し、分布外データ(最大30個のアイテムまたは数字)で一般化性能を評価。繰り返しの高いレベルを含む。
- T5、GPT-3、DeBERTaを用い、事前学習の有無を変えて実験し、相対的位置埋め込みといったアーキテクチャ的要因の影響を隔離する。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、繰り返しの多い記号や訓練分布を超える長大なシーケンスを含む場合、なぜコピー・反転といった単純な記号的変換タスクで失敗するのか?
- RQ2微細な計算ステップや明示的な位置マーカーは、記号的誘導タスクにおけるLLMsの一般化性能をどの程度向上できるか?
- RQ3実行可能なプログラムを用いることや、プログラムに依存しない手法は、算術および記号的推論におけるOOD一般化を改善できるか?
- RQ4構造的で段階的な指導法(LMs with tutor)は、標準的プロンプトが失敗するOODおよび高頻度繰り返しの記号的タスクで、LLMsが100%の正確性を達成できるか?
主な発見
- GPT-3 や T5 といった標準的LLMsは、加算やコピーのタスクで分布内では高い正確性を示すが、特に繰り返しの多い数字や長大なシーケンスを含むOOD入力では著しく性能が低下する。
- 微細なステップや明示的な位置マーカーを用いても、T5 や DeBERTa は反転タスクにおいて20〜30個を超えるアイテムでは一般化に失敗し、位置認識能力に限界があることが示された。
- 相対的位置埋め込みを備えたDeBERTaは、記号的タスクで急速に過学習を起こし、2,000ステップ未満で分布内正確度100%に達するが、OODデータでは失敗する。これは一般化性能が著しく低いことを示唆している。
- 『LMs with tutor』手法は、コピー、反転、加算タスクにおいて、すべてのOODおよび高頻度繰り返し設定で100%の正確性を達成し、すべてのベースラインを上回った。
- 実行可能なプログラムは、加算タスクにおけるOOD性能を向上させた。これは、基本的な記号的演算を明示的にモデル化する必要があることを示している。
- 本研究は、現在のLLMsが、規模を拡大しても、信頼できる位置認識および記号的誘導能力を備えていないことを明らかにした。構造的指導が、こうした限界を克服するために不可欠であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。