[論文レビュー] Humans and transformer LMs: Abstraction drives language learning
要約: 本研究はGPT-2の事前学習済みトランスフォーマーが、事例ベースのパターンよりも動詞クラスと統語構造の言語的抽象をより早く学習することを示し、抽象優先の学習バイアスをエン exemplar-basedアカウントより支持します。
Categorization is a core component of human linguistic competence. We investigate how a transformer-based language model (LM) learns linguistic categories by comparing its behaviour over the course of training to behaviours which characterize abstract feature-based and concrete exemplar-based accounts of human language acquisition. We investigate how lexical semantic and syntactic categories emerge using novel divergence-based metrics that track learning trajectories using next-token distributions. In experiments with GPT-2 small, we find that (i) when a construction is learned, abstract class-level behaviour is evident at earlier steps than lexical item-specific behaviour, and (ii) that different linguistic behaviours emerge abruptly in sequence at different points in training, revealing that abstraction plays a key role in how LMs learn. This result informs the models of human language acquisition that LMs may serve as an existence proof for.
研究の動機と目的
- 事前学習中にトランスフォーマー言語モデルが言語カテゴリをどのように獲得するかを調査する。
- LMの学習経路を抽象優先と事例優先の人間の言語獲得仮説と比較する。
- 次語分布の分岐ベースの指標を用いて語彙意味論と統語的カテゴリの出現を追跡する。
提案手法
- OpenWebTextで訓練されたGPT-2 smallモデルを450回チェックポイントで用いて学習経路をモニターする。
- クラス一般性と個別アイテム学習を評価するために次語分布間のペアワイズ分岐(D_JS)を定義する。
- 新規分岐ベース指標を用いて抽象優先と事例優先の予測とLMの経路を比較する。
- 意味論/議論構造の学習と統語的部分特徴づけ/非局所依存の評価の両方を行う。
- コーカウント共起ベクトルを用いたエクゼンプラーファーストのベースラインを含め、学習パターンを対比する。
実験結果
リサーチクエスチョン
- RQ1LMの学習経路はアイテム特有パターンよりも早期にクラス抽象を示すか。
- RQ2動詞クラス、他動性、フィラ―ギャップ依存などの現象を横断して、連続的な抽象優先学習が構築されるか。
- RQ3エクゼンプラーファーストのベースラインは訓練経路で観察されるLMの学習を説明できるか。
- RQ4LMにおけるさまざまな言語現象間で抽象の出現順序はどうなるか。
主な発見
- 抽象優先的挙動は複数の現象にわたり現れ、クラスレベルの区別がアイテムレベルの学習より早く出現する。
- 語彙アイテム個別よりもクラスの語彙構造が先に学習され、学習開始時期は現象によって異なる。
- 学習経路は抽象の逐次的出現を示し、意味論的動詞クラス → 他動性 → 相対節パターンの順で現れる。
- エクゼンプラーファーストのベースラインはGPT-2の学習経路を再現せず、抽象駆動型学習を記憶ベースの学習より支持する。
- 相対節学習はクラスベースの出現を示すが、クラス固有のタイミング差があり、一様な平行性ではない構造化抽象を示唆する。
- 観測された抽象優先パターンは一部の人間の言語獲得理論と整合する一方、LMは生得的抽象ではなく分布情報に依存する点を指摘する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。