Skip to main content
QUICK REVIEW

[论文解读] Low-Cost Recurrent Neural Network Expected Performance Evaluation

Andrés Camero, Jamal Toutouh|arXiv (Cornell University)|May 18, 2018
Machine Learning and Data Classification参考文献 22被引用 11
一句话总结

本文提出了一种低成本、无需训练的方法,通过采样随机权重初始化并拟合截断正态分布,来估计循环神经网络(RNN)架构的预期性能。关键贡献在于,估计的达到低MAE的概率与实际训练后的MAE之间存在强烈的负相关性(r ≈ -0.7 至 -0.9),从而可在无需完整训练的情况下实现高效的超参数搜索。

ABSTRACT

Recurrent neural networks are a powerful tool, but they are very sensitive to their hyper-parameter configuration. Moreover, training properly a recurrent neural network is a tough task, therefore selecting an appropriate configuration is critical. Varied strategies have been proposed to tackle this issue. However, most of them are still impractical because of the time/resources needed. In this study, we propose a low computational cost model to evaluate the expected performance of a given architecture based on the distribution of the error of random samples of the weights. We empirically validate our proposal using three use cases. The results suggest that this is a promising alternative to reduce the cost of exploration for hyper-parameter optimization.

研究动机与目标

  • 解决在超参数搜索过程中训练RNN带来的高计算成本问题。
  • 开发一种快速、无需训练的方法,用于估计RNN架构的预期性能。
  • 通过减少对完整训练的依赖,实现对大规模超参数空间的高效探索。
  • 在真实世界的时间序列数据集(如能耗和停车占用率)上验证该方法。
  • 探索随机权重采样作为架构排序和初始化的启发式方法的潜力。

提出的方法

  • 对于给定的RNN架构,在多个试验中从正态分布中随机初始化网络权重。
  • 针对每组随机权重配置,在验证集上计算平均绝对误差(MAE)。
  • 将观测到的MAE值拟合为截断正态分布,以估计达到目标MAE阈值的概率。
  • 将阈值处估计的累积分布函数(CDF)值用作该架构的性能代理指标。
  • 基于估计的低误差概率对架构进行排序,避免进行完整训练。
  • 通过比较使用Adam优化器训练后的实际MAE与估计概率,验证该方法。

实验结果

研究问题

  • RQ1随机权重采样是否能在不进行完整训练的情况下,提供可靠的RNN性能估计?
  • RQ2估计的低误差概率与实际训练后的MAE之间是否存在强相关性?
  • RQ3该方法在预测不同RNN架构的预期性能方面,其排序能力如何?
  • RQ4该方法是否可推广至RNN以外的其他深度学习架构?
  • RQ5估计的概率是否与神经元数量或网络深度相关?

主要发现

  • 在所有三个数据集上,估计的达到低MAE的概率与实际训练后的MAE之间均观察到中等到强烈的负相关性(r ≈ -0.7 至 -0.9)。
  • 该方法成功预测了具有一个隐藏层及最多100个LSTM单元的堆叠RNN架构的相对性能。
  • 基于随机采样估计的概率能够有效预测最终训练误差,从而实现在无需训练的情况下对架构进行排序。
  • 基于采样方法表现最佳的架构,在完整训练后也始终处于顶尖表现之列。
  • 该方法显著降低了超参数搜索中的完整训练需求,大幅减少了计算成本。
  • 该方法在自动化神经架构搜索中展现出作为启发式方法的潜力,且可扩展至更深或不同类型的网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。