[论文解读] Humans and transformer LMs: Abstraction drives language learning
本文表明 GPT-2 预训练变换器在对动词类和句法结构的语言学抽象方面的学习早于对项目特定模式的学习,支持在举例-先行的学习偏好之上更偏向抽象先行的解释。
Categorization is a core component of human linguistic competence. We investigate how a transformer-based language model (LM) learns linguistic categories by comparing its behaviour over the course of training to behaviours which characterize abstract feature-based and concrete exemplar-based accounts of human language acquisition. We investigate how lexical semantic and syntactic categories emerge using novel divergence-based metrics that track learning trajectories using next-token distributions. In experiments with GPT-2 small, we find that (i) when a construction is learned, abstract class-level behaviour is evident at earlier steps than lexical item-specific behaviour, and (ii) that different linguistic behaviours emerge abruptly in sequence at different points in training, revealing that abstraction plays a key role in how LMs learn. This result informs the models of human language acquisition that LMs may serve as an existence proof for.
研究动机与目标
- 研究变换器语言模型在预训练阶段如何获得语言类别。
- 将语言模型的学习轨迹与抽象先行与举例先行的人类语言习得理论进行比较。
- 使用基于发散度的度量,在下一个词分布上跟踪词汇语义与句法类别的出现。
提出的方法
- 使用在 OpenWebText 上训练的 GPT-2 小模型,设定 450 个检查点以监测学习轨迹。
- 定义下一个词分布之间的逐对发散度(D_JS)以评估类别普遍性学习与项目特定学习。
- 使用新的基于发散度的度量,将 LM 的轨迹与抽象先行和举例先行预测进行比较。
- 评估语义/论元结构学习和句法子范畴化/非局部依赖的学习。
- 包含一个基于计数的共现向量的举例先行基线,以对比学习模式。
实验结果
研究问题
- RQ1LM 的学习轨迹是否在类别层面表现出早期抽象,而非项目特定模式?
- RQ2语言结构在动词类、及及物性、填充-缺口依赖等现象上,是否以序贯的、抽象先行的方式被学习?
- RQ3举例先行基线是否能解释在训练轨迹中观察到的 LM 学习?
- RQ4在 LM 中不同语言现象的抽象出现顺序是什么?
主要发现
- 抽象先行的行为在多种现象中出现,类别层面的区分在对项目级学习之前就已出现。
- 对类别中的单词在个别词汇项之前学习了语言结构,且学习的起始因现象而异。
- 学习轨迹显示抽象的顺序性出现(语义动词类先,其次是及物性,随后是关系从句模式)。
- 举例先行基线并未复制 GPT-2 的学习轨迹,支持基于抽象的学习胜于基于举例的记忆。
- 相对从句的学习呈现出基于类别的出现,但仍存在某些类别特定的时序差异,表明存在结构化的抽象而非简单并行。
- 观察到的抽象先行模式与某些人类语言习得理论相符,同时指出语言模型依赖分布式数据而非天生抽象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。