[论文解读] Opening the AI black box: program synthesis via mechanistic interpretability
本文提出MIPS,一种完全自动化的程序合成方法,通过机制可解释性将神经网络策略逆向工程为可解释的Python代码。通过将RNN隐藏状态转换为离散整数或位表示,并应用符号回归,MIPS在无需人工编码示例的情况下提炼出学习到的算法,在62项算法任务中成功解决了32项——其中13项GPT-4未能解决——展示了其作为LLM代码生成的可扩展、可解释的替代方案的潜力。
We present MIPS, a novel method for program synthesis based on automated mechanistic interpretability of neural networks trained to perform the desired task, auto-distilling the learned algorithm into Python code. We test MIPS on a benchmark of 62 algorithmic tasks that can be learned by an RNN and find it highly complementary to GPT-4: MIPS solves 32 of them, including 13 that are not solved by GPT-4 (which also solves 30). MIPS uses an integer autoencoder to convert the RNN into a finite state machine, then applies Boolean or integer symbolic regression to capture the learned algorithm. As opposed to large language models, this program synthesis technique makes no use of (and is therefore not limited by) human training data such as algorithms and code from GitHub. We discuss opportunities and challenges for scaling up this approach to make machine-learned models more interpretable and trustworthy.
研究动机与目标
- 开发一种完全自动化的方法,从训练好的神经网络中提炼出可解释的符号化程序。
- 通过避免依赖人工编写的代码或示例,克服大语言模型在程序合成中的局限性。
- 通过自动化的机制可解释性,提升机器学习模型的可信度与可解释性。
- 测试自动化可解释性是否能够扩展到算法推理任务中的实际程序合成。
- 在算法领域为黑箱神经网络策略提供可验证的符号化替代方案。
提出的方法
- 训练一个具有前馈更新和输出函数的循环神经网络(RNN),以解决算法任务。
- 使用整数自编码器简化训练后的RNN,以提取隐藏状态的离散、有限状态表示。
- 通过识别隐藏表示中的离散状态转移,从简化后的网络中提取有限状态机。
- 应用符号回归(布尔或整数)以发现输入、隐藏状态与输出之间的精确数学或逻辑关系。
- 从符号关系生成人类可读的Python代码,并通过Dafny进行形式化验证以确保正确性。
- 采用无需搜索的流水线方法,而是通过训练期间学习算法,并借助可解释性进行提取。

实验结果
研究问题
- RQ1机制可解释性能否完全自动化,以从神经网络中提取符号化程序?
- RQ2这种自动化方法是否能在不使用人工编码示例的情况下,优于或补充大语言模型在程序合成中的表现?
- RQ3自动化程序合成在通常由RNN解决的算法任务基准上的表现如何?
- RQ4符号回归在从学习到的神经表示中恢复真实算法方面的有效性如何?
- RQ5所合成的程序是否能够通过形式化验证以确保其在安全关键场景下的可靠性?
主要发现
- MIPS在基准测试的62项算法任务中成功合成32个正确的Python代码,展示了其在程序合成中的高效性。
- 在上述32项任务中,有13项未被GPT-4解决,表明MIPS与LLM方法具有互补性而非替代性。
- 通过将RNN隐藏状态转换为离散整数和位表示,该方法在恢复真实算法方面表现出高保真度。
- 使用Dafny进行的形式化验证确认了所合成位加法程序的正确性,证明其在所有有效输入下均与预期行为等价。
- 该方法完全不依赖人工编写的代码,仅依赖输入输出对和神经网络训练,因此具备可扩展性和可信度。
- 在离散表示上应用符号回归,成功实现了对复杂逻辑(如模运算和迭代物理模拟)的精确恢复。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。