Skip to main content
QUICK REVIEW

[论文解读] Engineering Monosemanticity in Toy Models

Adam S. Jermyn, Nicholas Schiefer|arXiv (Cornell University)|Nov 16, 2022
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

本文表明,通过操控训练动态和网络结构选择,可以在小型、可处理的神经网络模型中工程化设计出单义神经元——即对单一可解释输入特征有响应的神经元。通过使用负向偏置初始化或增加模型宽度,作者在不损失性能的前提下实现了高度单义性的解决方案,从而实现了对单义神经元和多义神经元的完整机制可解释性。

ABSTRACT

In some neural networks, individual neurons correspond to natural ``features'' in the input. Such \emph{monosemantic} neurons are of great help in interpretability studies, as they can be cleanly understood. In this work we report preliminary attempts to engineer monosemanticity in toy models. We find that models can be made more monosemantic without increasing the loss by just changing which local minimum the training process finds. More monosemantic loss minima have moderate negative biases, and we are able to use this fact to engineer highly monosemantic models. We are able to mechanistically interpret these models, including the residual polysemantic neurons, and uncover a simple yet surprising algorithm. Finally, we find that providing models with more neurons per layer makes the models more monosemantic, albeit at increased computational cost. These findings point to a number of new questions and avenues for engineering monosemanticity, which we intend to study these in future work.

研究动机与目标

  • 探究是否可以在小型神经网络模型中系统性地工程化设计单义神经元。
  • 理解训练动态和网络结构选择如何影响神经网络中的单义性。
  • 开发在不增加损失或计算成本的前提下实现高单义性的方法。
  • 在这些工程化模型中实现对单义神经元和多义神经元的机制可解释性。

提出的方法

  • 使用两层前馈网络架构,包含一个线性变换(含偏置)后接非线性激活,再接第二层无偏置的线性层。
  • 在三个任务上进行训练:特征解码、随机重投影和绝对值计算,所有任务均具有已知的真实特征。
  • 通过学习率和偏置初始化控制训练动态,引导优化过程进入不同的局部最小值。
  • 对偏置应用权重衰减,系统性地将模型引导至更单义性的解。
  • 系统性地改变每层神经元数量,研究模型宽度对单义性的影响。
  • 通过分析神经元激活、输入/输出映射以及恢复特征中的干扰模式,实现机制可解释性。

实验结果

研究问题

  • RQ1是否可以在不降低性能的前提下,在小型、可解释的模型中工程化设计单义神经元?
  • RQ2学习率和偏置初始化等训练超参数的选择如何影响单义性?
  • RQ3增加每层神经元数量是否能提升单义性,若能,其代价是什么?
  • RQ4在训练后的模型中,单义神经元和多义神经元分别实现了何种计算算法?
  • RQ5偏置模式能否作为识别和工程化单义极小值的可靠信号?

主要发现

  • 使用较高学习率或负偏置初始化训练的模型,能在不降低性能的前提下收敛至更单义性的局部最小值。
  • 更单义性的极小值在所有三个任务中均表现出一致的中等负偏置。
  • 应用偏置权重衰减可实现高度单义性的模型,其性能与L1正则化相当。
  • 增加每层神经元数量可提升单义性,但代价是更高的计算负载。
  • 在单义极限下,单个神经元实现了在特征恢复与干扰抑制之间平衡的算法。
  • 每种特征由两个单义神经元联合分类为‘可能为真实’或‘可能为干扰’,并恢复真实特征的强度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。