Skip to main content
QUICK REVIEW

[论文解读] Reducing the Barriers to Entry for Foundation Model Training

Paolo Faraboschi, Ellis Giles|arXiv (Cornell University)|Apr 12, 2024
Hip disorders and treatmentsMedicine被引用 3
一句话总结

本文提出了一项人工智能训练基础设施的根本性转变——涵盖硬件、软件及系统级协同设计——以大幅降低基础模型训练的成本与能耗。通过利用模拟存内计算与基于能量的模型,作者展示了降低进入门槛的路径,使更广泛的群体能够参与,并推动大规模语言模型开发中的开放创新。

ABSTRACT

The world has recently witnessed an unprecedented acceleration in demands for Machine Learning and Artificial Intelligence applications. This spike in demand has imposed tremendous strain on the underlying technology stack in supply chain, GPU-accelerated hardware, software, datacenter power density, and energy consumption. If left on the current technological trajectory, future demands show insurmountable spending trends, further limiting market players, stifling innovation, and widening the technology gap. To address these challenges, we propose a fundamental change in the AI training infrastructure throughout the technology ecosystem. The changes require advancements in supercomputing and novel AI training approaches, from high-end software to low-level hardware, microprocessor, and chip design, while advancing the energy efficiency required by a sustainable infrastructure. This paper presents the analytical framework that quantitatively highlights the challenges and points to the opportunities to reduce the barriers to entry for training large language models.

研究动机与目标

  • 解决训练大型基础模型所导致的成本与能耗持续上升的问题。
  • 降低当前人工智能模型开发中的市场集中度,以避免限制创新并缩小技术差距。
  • 通过降低计算与财务门槛,使更多人能够参与基础模型的训练。
  • 探索革命性的硬件与算法方法,以实现训练成本与能耗的大幅降低。
  • 通过使大规模大语言模型训练对更多组织和研究人员可及,促进开放创新。

提出的方法

  • 提出一种协同设计框架,整合超级计算、加速计算以及从微处理器到数据中心规模的能效硬件。
  • 引入模拟存内计算(IMC),在内存中直接执行计算,避免昂贵的数模转换,从而降低能耗。
  • 利用非易失性纳米级存储器(如忆阻器ReRAM)用于推理,以及模拟CMOS用于训练,实现可扩展、低功耗的运算。
  • 应用基于能量的模型(EBMs),特别是受量子启发的霍普菲尔德神经网络,将大语言模型训练重新定义为在本征符号空间中的优化问题。
  • 使用混合信号存储电路与新型模拟纠错技术,提升精度并支持模型训练中的复杂高阶交互。
  • 重新设计标记表示方式,以在不扩展输入空间的前提下保留语义关系,从而减少对参数密集型架构的依赖。

实验结果

研究问题

  • RQ1为实现基础模型训练的可负担性与可持续性,硬件、软件与系统架构需要哪些系统性变革?
  • RQ2模拟存内计算在多大程度上可减少大规模大语言模型训练中的能耗与延迟瓶颈?
  • RQ3具有可编程高阶交互能力的基于能量的模型能否提升训练效率并降低计算成本?
  • RQ4在本征空间中采用符号化标记表示,能在多大程度上消除大语言模型对大规模参数化的依赖?
  • RQ5在端到端大语言模型训练中,使用混合信号模拟系统时,其可扩展性与精度之间存在何种权衡?

主要发现

  • 当前大语言模型训练的发展轨迹——每4个月参数量翻倍——导致成本与能耗持续不可持续增长,威胁市场集中化。
  • 通过在内存中直接执行计算,模拟存内计算可显著降低能耗与延迟,尤其在使用非易失性纳米级存储器进行推理、模拟CMOS用于训练时效果更显著。
  • 基于能量的模型,特别是受量子启发的霍普菲尔德网络,能够以紧凑的电路架构建模复杂高阶交互,从而实现解空间的指数级压缩。
  • 通过符号化表示标记并保留其语义关系,同时不扩展输入空间,可减少对大参数量的依赖,从而降低计算开销。
  • 混合信号存储电路与模拟纠错技术的集成,可实现可扩展、高精度的训练,适用于真实世界的大语言模型工作负载。
  • 在软件、算法与硬件之间实施协同设计,是实现成本与能耗大幅降低的关键,具有实现基础模型训练民主化的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。