[论文解读] AI capabilities can be significantly improved without expensive retraining
本文引入了计算等效增益(CEG)度量标准,用于量化后训练AI增强技术(如工具使用、提示工程和结构搭建)相对于通过微调实现相同性能提升所需计算量的性能增益。研究发现,许多增强技术可实现相当于5倍至20倍预训练计算量的性能增益,且成本仅为后者的极小部分,表明这些技术是推动AI能力增长的高效手段。
State-of-the-art AI systems can be significantly improved without expensive retraining via "post-training enhancements"-techniques applied after initial training like fine-tuning the system to use a web browser. We review recent post-training enhancements, categorizing them into five types: tool-use, prompting methods, scaffolding, solution selection, and data generation. Different enhancements improve performance on different tasks, making it hard to compare their significance. So we translate improvements from different enhancements into a common currency, the compute-equivalent gain: how much additional training compute would be needed to improve performance by the same amount as the enhancement. Our non-experimental work shows that post-training enhancements have significant benefits: most surveyed enhancements improve benchmark performance by more than a 5x increase in training compute, some by more than 20x. Post-training enhancements are relatively cheap to develop: fine-tuning costs are typically <1% of the original training cost. Governing the development of capable post-training enhancements may be challenging because frontier models could be enhanced by a wide range of actors.
研究动机与目标
- 使用统一度量标准量化后训练增强对AI能力的影响,以克服跨不同技术比较性能增益的挑战。
- 评估后训练增强相对于额外预训练计算成本的性能提升程度。
- 评估后训练增强对AI发展与治理在经济和战略层面的影响。
- 探索这些增强技术如何重塑AI进步轨迹,并影响未来安全与政策决策。
提出的方法
- 提出计算等效增益(CEG)度量标准:为实现与特定后训练增强相同性能提升,所需额外预训练计算量。
- 将后训练增强技术分为五类:工具使用、提示工程、结构搭建、解决方案选择和数据生成。
- 通过比较增强前后在基准测试上的模型表现,估算CEG值,假设在相同预训练数据分布下,性能提升可由计算量增加实现。
- 通过将增强技术的一次性成本和运行时成本与原始预训练成本进行比较,评估其成本效率。
- 利用现有研究中的基准数据(如MATH、HumanEval、GSM8K)估算不同任务和增强类型下的CEG值。
- 应用CEG框架评估多种增强技术的累积效应与边际递减效应,并分析其能力特征与随时间的改进速率。

实验结果
研究问题
- RQ1后训练增强相对于通过微调实现相同性能提升所需计算量,能带来多大程度的性能增益?
- RQ2与增加预训练计算量相比,开发和部署后训练增强技术的相对成本如何?
- RQ3后训练增强是否带来可泛化的能力建设,还是仅限于特定任务?
- RQ4多种增强技术之间如何相互作用?是否存在收益递减或性能上限?
- RQ5通过后训练实现广泛且低成本的能力提升,对AI治理与安全政策有何影响?
主要发现
- 大多数调研的后训练增强技术带来的性能增益,相当于超过5倍的额外预训练计算量,部分甚至达到20倍以上。
- 大多数增强技术的微调成本低于原始预训练成本的1%,相较于重新训练,表现出极高的成本效益。
- 后训练增强技术通常具有领域特定性,而预训练扩展则能普遍提升多种任务的性能。
- 计算等效增益(CEG)为跨不同基准和领域比较多样化后训练技术的影响提供了一个有用且标准化的度量标准。
- 通过后训练增强实现持续进步的潜力巨大,但收益递减或性能上限是否存在,仍是开放问题。
- 后训练增强技术的广泛可及性——可能被众多不同主体实现改进——为AI治理与安全监管带来了独特挑战。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。