[论文解读] Energy Consumption of Deep Generative Audio Models
本文提出了一种多目标Pareto最优性框架,通过联合优化生成质量(通过MOS衡量)和训练与推理过程中的能耗,来评估深度生成音频模型。结果表明,SOTA模型如WaveFlow通常处于Pareto支配之下,揭示了高质量模型往往伴随不成比例的高能耗,呼吁研究社区在模型开发中优先考虑能效问题。
In most scientific domains, the deep learning community has largely focused on the quality of deep generative models, resulting in highly accurate and successful solutions. However, this race for quality comes at a tremendous computational cost, which incurs vast energy consumption and greenhouse gas emissions. At the heart of this problem are the measures that we use as a scientific community to evaluate our work. In this paper, we suggest relying on a multi-objective measure based on Pareto optimality, which takes into account both the quality of the model and its energy consumption. By applying our measure on the current state-of-the-art in generative audio models, we show that it can drastically change the significance of the results. We believe that this type of metric can be widely used by the community to evaluate their work, while putting computational cost -- and in fine energy consumption -- in the spotlight of deep learning research.
研究动机与目标
- 为解决当前评估生成音频模型时缺乏能耗指标的问题,目前的评估方法更侧重质量而非计算成本。
- 使用真实硬件和训练数据,量化最先进的生成音频模型在训练和推理过程中的能耗。
- 提出一种多目标评估框架,通过Pareto最优性平衡模型质量(通过MOS衡量)与能效。
- 证明当前SOTA模型通常处于Pareto支配之下,揭示了质量与能耗之间权衡的低效性。
- 倡导将能效作为深度学习研究中的核心标准,尤其是在生成建模领域。
提出的方法
- 基于硬件(TITAN V)、训练时间和批量大小,使用Carbontracker估算训练能耗(单位:kWh)。
- 在单个GPU上生成10段10秒的音频片段,测量推理能耗(单位:Wh)。
- 采用原始WaveFlow论文中的平均意见得分(MOS),并归一化为1−%MOS以用于最小化优化。
- 应用Pareto最优性比较不同模型配置在训练成本和推理成本两个目标上的表现。
- 分析五种具有不同残差通道数(64, 96, 128, 256)的WaveFlow配置,评估模型规模、质量与能耗之间的权衡。
- 通过可视化Pareto前沿,识别非支配模型,突出在质量-能耗联合空间中表现最优的模型。
实验结果
研究问题
- RQ1WaveFlow不同配置的训练与推理能耗如何变化?
- RQ2当前最先进的生成音频模型在质量与能效之间实现平衡的程度如何?
- RQ3Pareto最优性能否有效识别在质量和能耗方面均表现最优的模型?
- RQ4模型规模和训练步数对生成音频模型能耗成本有何影响?
- RQ5评估中缺乏能耗指标如何扭曲了文献中对模型性能的认知?
主要发现
- 具有256个残差通道的WaveFlow模型(WF₃)处于Pareto支配之下,意味着其质量更低且能耗更高,相较于其他配置。
- 增加模型规模和训练步数可提升MOS(质量),但导致训练能耗显著上升,WF₃的能耗超过较小模型的三倍以上。
- 推理能耗不可忽视:在22.05kHz下生成10段10秒的音频片段,每段消耗1.2–2.5 Wh,具体取决于模型规模。
- Pareto前沿显示,具有96和128个残差通道的模型在质量与能耗之间提供了比大模型更优的权衡。
- 本研究表明,当前生成音频建模的评估实践忽视了能耗成本,可能导致模型开发的不可持续性。
- 所提出的多目标评估框架成功识别出非支配模型,证明了其在指导高效模型设计方面的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。