[论文解读] Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
论文表明,为预测黑白棋局中合法落子而训练的GPT变体能够形成对棋盘状态的非线性内部表示,并通过干预展示它们对预测的因果影响,并引入潜在显著性图用于可解释性。
Language models show a surprising range of capabilities, but the source of their apparent competence is unclear. Do these networks just memorize a collection of surface statistics, or do they rely on internal representations of the process that generates the sequences they see? We investigate this question by applying a variant of the GPT model to the task of predicting legal moves in a simple board game, Othello. Although the network has no a priori knowledge of the game or its rules, we uncover evidence of an emergent nonlinear internal representation of the board state. Interventional experiments indicate this representation can be used to control the output of the network and create "latent saliency maps" that can help explain predictions in human terms.
研究动机与目标
- 研究序列模型在一个合成任务上训练时,是否会发展出超越表面统计的内部世界表示。
- 检查新兴的棋盘状态表示是否是非线性的,并对预测具有因果影响。
- 开发并验证干预技术以操纵内部表示并评估其因果作用。
- 引入潜在显著性图,以可视化和解释模型在棋盘游戏设置中的预测。
提出的方法
- 训练一个8层的GPT变体(Othello-GPT),使用表示奥赛罗棋盘瓷砖的60-token词汇来从部分转写中预测下一个合法落子。
- 使用两组数据:一个包含专家人类落子的冠军数据集和一个包含随机合法落子的大型合成数据集。
- 评估模型在验证数据上预测合法落子的能力(前1名合法性错误率)。
- 使用线性和非线性分类器对内部激活进行探针,以从中间层推断棋盘状态表示。
- 应用一种干预技术,通过梯度下降优化激活以强制对照事实棋盘状态,并观察预测的变化。
- 通过干预将对单个棋盘瓷砖状态的状态变化归因,从而构建潜在显著性图。
实验结果
研究问题
- RQ1GPT风格的序列模型在从棋盘博弈转录本学习时,是否会形成对游戏状态的内部、非线性表示(世界观)?
- RQ2这些新兴的表示是否与模型的下步预测具有因果关系?
- RQ3激活干预是否能揭示并操纵模型的内部世界模型?
- RQ4潜在显著性图是否能为棋盘状态如何影响预测提供可解释的可视化?
主要发现
- Othello-GPT在合成数据(0.01%)和冠军数据(5.17%)上预测合法落子错误率极低,远优于未训练基线(93.29%)。
- 线性探针在恢复棋盘状态方面表现较差(各层错误率普遍>20%),而非线性探针(2层MLP)实现显著更低的错误率,表明存在非线性内部表示。
- 改变内部激活以改变单个棋盘瓷砖状态的干预可以因果地影响下步预测,最佳结果出现在干预层Ls=4上(自然和非自然子集的平均错误分别为0.12和0.06)。
- 潜在显著性图显示在合成模型中对瓷砖的区域性显著性,与合法性模式相一致;在冠军训练的模型中,显现出更复杂的模式。
- 潜在显著性可视化区分了在合成训练与冠军训练下学习到的表示,体现了该方法的可解释性应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。