[论文解读] Low-Precision Random Fourier Features for Memory-Constrained Kernel Approximation
本文提出低精度随机傅里叶特征(LP-RFFs),在严格内存约束下实现高秩核近似。通过将RFFs量化为低精度定点表示,LP-RFFs在保持与全精度RFFs及Nyström方法相当的泛化性能的同时,分别将内存使用量减少3倍至10倍和50倍至460倍,并在改进的误差度量下提供了近似质量的理论保证。
We investigate how to train kernel approximation methods that generalize well under a memory budget. Building on recent theoretical work, we define a measure of kernel approximation error which we find to be more predictive of the empirical generalization performance of kernel approximation methods than conventional metrics. An important consequence of this definition is that a kernel approximation matrix must be high rank to attain close approximation. Because storing a high-rank approximation is memory intensive, we propose using a low-precision quantization of random Fourier features (LP-RFFs) to build a high-rank approximation under a memory budget. Theoretically, we show quantization has a negligible effect on generalization performance in important settings. Empirically, we demonstrate across four benchmark datasets that LP-RFFs can match the performance of full-precision RFFs and the Nyström method, with 3x-10x and 50x-460x less memory, respectively.
研究动机与目标
- 为解决核近似方法中的内存瓶颈问题,这些方法需要大量特征才能实现良好泛化。
- 寻找比传统范数(如Frobenius或谱误差)更具预测性的核近似误差度量。
- 设计一种内存高效的近似方法,在固定内存预算下保持高泛化性能。
- 证明低精度量化随机傅里叶特征可在不损失性能的前提下实现高秩近似。
提出的方法
- 引入一种改进的误差度量——$(\Delta_1, \Delta_2)$-谱近似,其对泛化的预测能力优于传统范数。
- 提出低精度随机傅里叶特征(LP-RFFs),将每个特征存储为低比特定点格式,从而在内存预算内增加特征数量。
- 理论上证明:当噪声远小于正则化参数时,量化对泛化性能的影响可忽略不计。
- 采用LM-HALP训练算法进行低精度模型训练,支持快速低精度矩阵运算并减少模型参数的内存占用。
- 应用双重采样以减少梯度偏差,但初步实验未显示性能显著提升。
实验结果
研究问题
- RQ1为何标准核近似误差度量(如Frobenius范数和谱范数)在实践中无法有效预测泛化性能?
- RQ2能否通过随机傅里叶特征的低精度量化,在显著减少内存使用的同时保持泛化性能?
- RQ3$(\Delta_1, \Delta_2)$-谱近似度量为何能比传统度量更好地解释Nyström与RFFs之间的相对性能表现?
- RQ4结合LP-RFFs时,低精度模型训练对最终模型准确率有何影响?
主要发现
- 在TIMIT数据集上,50,000个标准RFFs实现的保留集准确率与20,000个Nyström特征相当,但内存使用量减少10倍,尽管Nyström的Frobenius误差小1.7倍、谱误差小17倍。
- LP-RFFs在四个基准数据集(TIMIT、YearPred、CovType、Census)上与全精度RFFs及Nyström方法性能相当,同时相比全精度RFFs内存使用减少3倍至10倍。
- 与Nyström方法相比,LP-RFFs将内存使用量减少50倍至460倍,充分体现了在内存受限条件下的显著效率优势。
- 采用8位LP-RFFs与8位LM-HALP训练时,当特征数量至少为10,000时,模型性能可与全精度训练相媲美。
- 在Gaussian核的YearPred数据集上,初步实验中双重采样未带来明显的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。