[论文解读] Evolution through Large Models
该论文提出了通过大规模模型进化(ELM),一种利用代码生成大型语言模型(LLM)作为遗传编程(GP)中智能突变算子的方法,显著提升了搜索效率。通过提示LLM生成类人、功能性的代码修改,ELM使GP能够从单一、平庸的人工编写的种子代码出发,演化出复杂且可工作的Python程序,例如在Sodarace领域中的行走机器人,最终为特定地形的机器人设计自动生成新的条件模型。
This paper pursues the insight that large language models (LLMs) trained to generate code can vastly improve the effectiveness of mutation operators applied to programs in genetic programming (GP). Because such LLMs benefit from training data that includes sequential changes and modifications, they can approximate likely changes that humans would make. To highlight the breadth of implications of such evolution through large models (ELM), in the main experiment ELM combined with MAP-Elites generates hundreds of thousands of functional examples of Python programs that output working ambulating robots in the Sodarace domain, which the original LLM had never seen in pre-training. These examples then help to bootstrap training a new conditional language model that can output the right walker for a particular terrain. The ability to bootstrap new models that can output appropriate artifacts for a given context in a domain where zero training data was previously available carries implications for open-endedness, deep learning, and reinforcement learning. These implications are explored here in depth in the hope of inspiring new directions of research now opened up by ELM.
研究动机与目标
- 解决在遗传编程(GP)中,当演化程序的领域远离LLM训练数据分布时,突变效率低下的挑战。
- 探索LLM如何作为智能、类人的扰动算子,引导进化搜索朝向功能性解决方案。
- 证明LLM生成的数据可用来为此前无任何训练数据的新领域自动生成并微调新模型。
- 研究ELM在实现开放-ended、分布偏移发现中的作用,通过生成多样且功能性的产物,突破LLM原始训练数据的分布范围。
- 通过在ELM生成数据上微调,实现对特定领域产物(如适应特定地形的机器人)的条件生成,推动强化学习和深度学习中的应用进展。
提出的方法
- 利用预训练的代码生成LLM作为遗传编程流程中的突变算子,生成合理且功能性的代码变更。
- 应用MAP-Elites算法,在Python程序空间中探索并保留多样且功能性的Sodarace机器人设计,使用LLM生成的突变。
- 即使LLM此前未接触过该领域,仍生成了数十万条代表Sodarace领域行走机器人的功能性Python程序。
- 在ELM生成的数据集上微调原始LLM,创建一个能够生成针对特定地形定制的机器人的条件语言模型。
- 利用强化学习(RL)进一步优化条件模型,使其能够根据地形输入生成合适的机器人形态。
- 利用生成的数据在初始无任何训练数据的领域中自举生成新模型,展示了自我改进、开放式的发现循环。
实验结果
研究问题
- RQ1预训练的代码生成LLM能否作为有效、智能的突变算子,在其训练数据分布之外的领域中用于遗传编程?
- RQ2在无标注数据的情况下,LLM通过进化搜索生成的数据在多大程度上可用于训练新的、领域特定的模型?
- RQ3ELM与MAP-Elites的结合能否从单一人工编写的种子代码出发,在一个新领域中生成多样且功能性的产物(如Sodarace机器人)?
- RQ4ELM生成的数据能否支持训练一个条件语言模型,使其能够生成适配特定地形的机器人设计?
- RQ5ELM如何通过持续生成新颖、分布外的解决方案,促进开放性发现?
主要发现
- 尽管LLM此前未接触过Sodarace领域,ELM仍成功生成了数十万条代表行走机器人的功能性Python程序。
- ELM生成的数据集足以用于微调一个新的条件语言模型,使其能够生成针对特定地形的Sodarace机器人,而这一任务在无预训练模型的情况下无法从零开始训练。
- 强化学习进一步提升了条件模型的性能,使其能够根据地形输入生成合适的机器人形态。
- 基于LLM的突变算子在引导进化搜索向复杂且陌生领域中的功能性解决方案方面,显著优于传统突变方法。
- ELM流程展示了自我维持的发现循环:ELM生成的数据支持新模型的训练,而新模型又能生成更多样化、更精准的解决方案。
- 该方法通过持续生成新颖且功能性的产物,突破原始训练数据分布,实现了开放式的演化,支持新能力的涌现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。