Skip to main content
QUICK REVIEW

[論文レビュー] Post-Training 4-bit Quantization on Embedding Tables

Hui Guan, Andrey Malevich|arXiv (Cornell University)|Nov 5, 2019
Recommender Systems and Techniques参考文献 22被引用数 16
ひとこと要約

本稿では、レコメンデーションシステムにおける埋め込みテーブルに対して、グリーディ探索を用いた行単位の均一量子化とk-meansクラスタリングを用いたコードブックベースの量子化を提案することで、トレーニング後4ビット量子化を実現する。この手法は、元のモデルサイズをわずか13.89%に削減しながら、生産環境でのFacebookランク付けモデルで性能に影響を及げない高い精度保持を達成した。

ABSTRACT

Continuous representations have been widely adopted in recommender systems where a large number of entities are represented using embedding vectors. As the cardinality of the entities increases, the embedding components can easily contain millions of parameters and become the bottleneck in both storage and inference due to large memory consumption. This work focuses on post-training 4-bit quantization on the continuous embeddings. We propose row-wise uniform quantization with greedy search and codebook-based quantization that consistently outperforms state-of-the-art quantization approaches on reducing accuracy degradation. We deploy our uniform quantization technique on a production model in Facebook and demonstrate that it can reduce the model size to only 13.89% of the single-precision version while the model quality stays neutral.

研究の動機と目的

  • 大規模レコメンデーションシステムにおいて埋め込みテーブルがモデルサイズを支配する中で、メモリと推論遅延を低減する課題に対処すること。
  • トレーニングデータが利用できない状況でも、精度の劣化を最小限に抑えるトレーニング後4ビット量子化技術を開発すること。
  • ヒストグラムや分布仮定に基づく従来の量子化手法が、小さな埋め込み行ベクトルでは失敗することを克服すること。
  • 高いモデル忠実度を維持しながら極端な圧縮を可能にする、効率的で実装可能な量子化手法を設計すること。
  • Facebookの本番システムに実際に導入することで、実用的妥当性を示すこと。

提案手法

  • 平均二乗誤差の局所的最小値を繰り返し探索することで、最適なクリッピングしきい値を特定する、行単位の均一量子化とグリーディ探索。
  • スケールおよびバイアスパラメータにFP16精度を用いることで、量子化誤差を増加させずにモデルサイズをさらに削減。
  • k-meansクラスタリングを用いたコードブックベースの量子化により、非一様に分布する値への入力ベクトルのマッピングを実現し、表現忠実度を向上。
  • 2段階のk-meansクラスタリング(KMEANS-CLS)を採用することで、コードブックサイズを削減しながらも精度を維持。
  • さまざまな埋め込み次元と量子化手法に対して、正規化されたℓ₂損失を用いた量子化誤差の実証的評価。
  • ACIQ、ヒストグラムベースのクリッピング、対称/非対称量子化を含む、最先端の手法と全手法の比較。

実験結果

リサーチクエスチョン

  • RQ1従来の手法が失敗する状況下でも、トレーニング後4ビット量子化が埋め込みテーブルにおいて顕著な精度劣化を引き起こさずに実現可能か?
  • RQ2小さな埋め込み行ベクトルに対して、分布に基づくまたはヒストグラムベースのクリッピングと比較して、クリッピングしきい値に対するグリーディ探索が優れているか?
  • RQ3k-meansクラスタリングを用いたコードブックベースの量子化は、同じ圧縮率において均一量子化よりも高い精度を達成できるか?
  • RQ4実世界の本番環境において、モデル品質を維持したまま、どの程度モデルサイズを削減できるか?
  • RQ5均一量子化においてスケールおよびバイアスパラメータにFP16を用いることで、誤差を増加させずにモデルサイズをさらに削減できるか?

主な発見

  • グリーディ探索を用いた行単位の均一量子化により、生産環境のFacebookランク付けモデルで、元の単精度モデルサイズの13.89%にまで削減され、性能に影響を及げない精度を維持した。
  • 提案手法のグリーディ探索法は、さまざまな埋め込み次元において、全4ビット均一量子化手法の中で最小の正規化ℓ₂損失(0.03889~0.06221)を達成した。
  • k-meansクラスタリングを用いたコードブックベースの量子化は、最小の正規化ℓ₂損失(0.03670~0.05781)を達成し、元のモデルと同等のログ損失を維持しながら、モデルサイズを元の18.8%~37.5%にまで削減した。
  • グリーディ手法においてスケールおよびバイアスパラメータにFP16を用いることで、d=128の状況でモデルサイズを元の13.28%にまで削減し、性能に測定可能な損失は生じなかった。
  • ACIQ、ヒストグラムベースのクリッピング、対称量子化といった最先端の手法と比較して、両方の量子化誤差とモデル精度の両面で本手法が優れていた。
  • 実証的結果から、従来の4ビット量子化手法は、小さな埋め込み行ベクトルに適用された場合、単純な範囲ベースのクリッピングと同等の性能にしかならず、新たなアプローチの必要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。