Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Scaling Laws for Recommendation Models

Newsha Ardalani, Carole-Jean Wu|arXiv (Cornell University)|Aug 17, 2022
Complex Network Analysis Techniques被引用数 5
ひとこと要約

本論文は、深層学習推薦モデル(DLRM)の実験的スケーリング法則を確立し、クリックスルーレート(CTR)性能がモデルサイズ、データサイズ、計算量の関数としてべき乗則+定数に従うことを示している。パラメータスケーリングはすでに飽和に近づいていることが判明し、アーキテクチャの飛躍的進歩が現れるまでは、データスケーリングが最も効率的な道筋となる。

ABSTRACT

Scale has been a major driving force in improving machine learning performance, and understanding scaling laws is essential for strategic planning for a sustainable model quality performance growth, long-term resource planning and developing efficient system infrastructures to support large-scale models. In this paper, we study empirical scaling laws for DLRM style recommendation models, in particular Click-Through Rate (CTR). We observe that model quality scales with power law plus constant in model size, data size and amount of compute used for training. We characterize scaling efficiency along three different resource dimensions, namely data, parameters and compute by comparing the different scaling schemes along these axes. We show that parameter scaling is out of steam for the model architecture under study, and until a higher-performing model architecture emerges, data scaling is the path forward. The key research questions addressed by this study include: Does a recommendation model scale sustainably as predicted by the scaling laws? Or are we far off from the scaling law predictions? What are the limits of scaling? What are the implications of the scaling laws on long-term hardware/system development?

研究の動機と目的

  • DLRMアーキテクチャの実験的スケーリング法則を特定すること、特にクリックスルーレート(CTR)予測に関して。
  • データサイズ、モデルパラメータ、計算予算の3次元におけるスケーリング効率を評価すること。
  • 現在の推薦モデルにおけるスケーリング傾向が理論的スケーリング法則と一致しているか、それとも顕著に逸脱しているかを特定すること。
  • 将来のモデル成長とリソース要件を予測することで、長期的なシステムおよびハードウェア設計を支援すること。
  • しばしば過去の研究で無視されてきた埋め込みパラメータが、全体のモデルスケーリング行動に与える影響を評価すること。

提案手法

  • モデルサイズ(N)、データサイズ(D)、計算予算(C)の3つの次元で、3桁のスケールにわたるCTRモデルの性能を実験的に測定する。
  • 性能曲線をべき乗則+定数関数にフィットさせる:$ L(x) = \alpha x^{-\beta} + \gamma $、ここで $ x $ は D、N、または C を表す。
  • 4つのスケーリング方式を比較する:縦型/横型埋め込みスケーリング、オーバーアーキ層スケーリング、および完全なMLP幅スケーリング。
  • すべての実験で正規化された交差エントロピー損失を性能指標として使用する。
  • 指数 $ \beta $ と定数 $ \gamma $ を用いてスケーリング効率を分析し、$ \gamma $ は無限大スケールにおける理論的性能限界を示す。
  • フィットされたべき乗則から導出されるデータ効率、パラメータ効率、計算効率の指標を用いて、スケーリング技術を比較する。

実験結果

リサーチクエスチョン

  • RQ1推薦モデルは、べき乗則の予測に従って持続的にスケーリング可能か、それとも顕著に逸脱するか?
  • RQ2データスケーリング、パラメータスケーリング、計算スケーリングの相対的な効率は、CTRモデル性能の向上においてどのように異なるか?
  • RQ3埋め込みテーブルスケーリング(縦型/横型)、MLP層スケーリング、オーバーアーキ層スケーリングといった異なるスケーリング方式は、リソース1単位あたりの性能向上の観点でどのように比較されるか?
  • RQ4現在のDLRMアーキテクチャにおけるスケーリングの実用的限界は何か?パラメータスケーリングはいつから非効率になるか?
  • RQ5スケーリング法則は、大規模な推薦システムの長期的ハードウェアおよびシステムインfra構築計画にどのように貢献できるか?

主な発見

  • CTRモデル性能は、モデルサイズ、データサイズ、計算予算に関して、べき乗則+定数の関係に従い、すべての曲線で $ R^2 > 0.99 $ を達成している。
  • パラメータスケーリングには限界効果が見られる:パラメータスケーリングの指数 $ \beta $ はほぼゼロ(0–0.5)であり、パラメータ増加に伴う性能向上が極めて小さいことを示している。
  • データスケーリングが最も効率的な道筋であり、データ効率指数 $ \beta = 0.07 $ であり、パラメータスケーリングよりも顕著に優れている。
  • 計算スケーリングの効率は高い($ \beta = 0.11 $)が、依然としてデータスケーリングに劣り、リターンオブインベストメント(ROI)の観点でもデータスケーリングに劣る。
  • べき乗則における定数項 $ \gamma $ は0.98(正規化エントロピー)で上限に達しており、現在のモデルが理論的無限大スケール性能限界の2%以内に収束していることを示している。
  • 埋め込みパラメータはモデル容量の90%以上を占めており、そのスケーリング行動は極めて重要である。縦型および横型埋め込みスケーリングは同等の効率を示すが、いずれもデータスケーリングに劣る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。