Skip to main content
QUICK REVIEW

[论文解读] Post-Training 4-bit Quantization on Embedding Tables

Hui Guan, Andrey Malevich|arXiv (Cornell University)|Nov 5, 2019
Recommender Systems and Techniques参考文献 22被引用 16
一句话总结

本文提出了一种基于贪婪搜索的逐行均匀量化方法,以及基于 k-means 聚类的码本量化方法,以实现在推荐系统嵌入表上的后训练 4 位量化。该方法实现了最先进的精度保持效果,在将模型大小缩减至原始大小的 13.89% 的同时,仍能在 Facebook 生产环境中的排名模型上保持中性性能。

ABSTRACT

Continuous representations have been widely adopted in recommender systems where a large number of entities are represented using embedding vectors. As the cardinality of the entities increases, the embedding components can easily contain millions of parameters and become the bottleneck in both storage and inference due to large memory consumption. This work focuses on post-training 4-bit quantization on the continuous embeddings. We propose row-wise uniform quantization with greedy search and codebook-based quantization that consistently outperforms state-of-the-art quantization approaches on reducing accuracy degradation. We deploy our uniform quantization technique on a production model in Facebook and demonstrate that it can reduce the model size to only 13.89% of the single-precision version while the model quality stays neutral.

研究动机与目标

  • 为解决大规模推荐系统中嵌入表主导模型大小的问题,降低内存占用和推理延迟。
  • 开发后训练 4 位量化技术,以最小化精度退化,尤其是在无法获取训练数据的情况下。
  • 克服现有量化方法(基于直方图或分布假设)在小尺寸嵌入行向量上失效的局限性。
  • 设计高效且可部署的量化方法,在实现极端压缩的同时保持高模型保真度。
  • 通过在 Facebook 实际生产系统中部署该方法,证明其实际可行性。

提出的方法

  • 采用逐行均匀量化结合贪婪搜索,通过迭代探索均方误差的局部最小值,寻找最优裁剪阈值。
  • 使用 FP16 精度存储缩放和偏置参数,进一步减小模型大小,同时不增加量化误差。
  • 通过 k-means 聚类实现基于码本的量化,将输入向量映射到非均匀分布的值,提升表示保真度。
  • 采用两级 k-means 聚类(KMEANS-CLS),在保持精度的同时减小码本大小。
  • 通过在不同嵌入维度下使用归一化 ℓ₂ 损失,对量化误差进行实证评估。
  • 将所有方法与最先进的方法(包括 ACIQ、基于直方图的裁剪,以及对称/非对称量化)进行对比。

实验结果

研究问题

  • RQ1当先前方法失效时,后训练 4 位量化能否在嵌入表上实现可忽略的精度退化?
  • RQ2对于小尺寸嵌入行向量,对裁剪阈值的贪婪搜索是否优于基于分布或直方图的裁剪方法?
  • RQ3在相同压缩率下,基于码本的量化(使用 k-means 聚类)能否实现优于均匀量化的精度?
  • RQ4在真实生产环境中,模型大小可被压缩到何种程度,同时仍能保持模型质量?
  • RQ5在均匀量化中使用 FP16 存储缩放和偏置参数,是否能在不增加误差的前提下进一步减小模型大小?

主要发现

  • 采用贪婪搜索的逐行均匀量化将模型大小缩减至原始单精度模型的 13.89%,同时在 Facebook 生产环境的排名模型中保持了中性精度。
  • 所提出的贪婪搜索方法在不同嵌入维度下,所有 4 位均匀量化方法中实现了最低的归一化 ℓ₂ 损失(0.03889–0.06221)。
  • 基于 k-means 聚类的码本量化实现了最小的归一化 ℓ₂ 损失(0.03670–0.05781),并在将模型大小缩减至原始大小的 18.8%–37.5% 的同时,与原始模型的对数损失保持一致。
  • 在贪婪方法中使用 FP16 存储缩放和偏置参数,使模型大小在 d=128 时缩减至原始大小的 13.28%,且性能无明显损失。
  • 该方法在量化误差和模型精度方面均优于最先进的方法,如 ACIQ、基于直方图的裁剪以及对称量化。
  • 实证结果表明,先前的 4 位量化方法在应用于小尺寸嵌入行向量时,其性能并不优于简单的基于范围的裁剪,从而验证了新方法的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。