Skip to main content
QUICK REVIEW

[論文レビュー] Efficient and Robust Quantization-aware Training via Adaptive Coreset Selection

Xijie Huang, Zechun Liu|arXiv (Cornell University)|Jun 12, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、誤差ベクトルスコア(EVS)と不一致スコア(DS)の2つの指標を用いて、情報を多く含むトレーニングサンプルを動的に選択することで、トレーニングの効率性と正確性を向上させる、新しい量子化に配慮したトレーニング手法である適応的コアセット選択(ACS)を提案する。トレーニングエポックにわたってこれらの指標を適応的にバランスさせることで、ImageNet-1Kデータのたった10%を用いても最先端の性能を達成し、4ビット量子化されたResNet-18ではトップ1精度68.39%を達成した。これはランダム選択と比較して4.24%の絶対的向上である。

ABSTRACT

Quantization-aware training (QAT) is a representative model compression method to reduce redundancy in weights and activations. However, most existing QAT methods require end-to-end training on the entire dataset, which suffers from long training time and high energy costs. In addition, the potential label noise in the training data undermines the robustness of QAT. We propose two metrics based on analysis of loss and gradient of quantized weights: error vector score and disagreement score, to quantify the importance of each sample during training. Guided by these two metrics, we proposed a quantization-aware Adaptive Coreset Selection (ACS) method to select the data for the current training epoch. We evaluate our method on various networks (ResNet-18, MobileNetV2, RetinaNet), datasets(CIFAR-10, CIFAR-100, ImageNet-1K, COCO), and under different quantization settings. Specifically, our method can achieve an accuracy of 68.39\% of 4-bit quantized ResNet-18 on the ImageNet-1K dataset with only a 10\% subset, which has an absolute gain of 4.24\% compared to the baseline. Our method can also improve the robustness of QAT by removing noisy samples in the training set.

研究の動機と目的

  • 大規模データセットにおける量子化に配慮したトレーニング(QAT)の高い計算コストと長時間のトレーニングを解決すること。
  • トレーニングデータセット内のデータの重複度が、正確性を損なわずQATの効率を向上させることに活用可能かどうかを調査すること。
  • 量子化モデルトレーニングの独自のダイナミクスを考慮し、QATに特化したコアセット選択戦略を開発すること。
  • 損失勾配と知識蒸留のダイナミクスの両方を反映するように、QAT中におけるサンプルの重要性を正確に反映する指標を設計すること。
  • 多様なネットワークとデータセットにおいて、QATにおける顕著なデータ効率の向上を達成するとともに、モデルの正確性を維持または向上させること。

提案手法

  • QAT中の損失勾配解析に基づく理論的近似として、サンプルの重要性を定量化する誤差ベクトルスコア(EVS)を提案する。
  • フル精度モデルと量子化モデルの予測ギャップを測定する不一致スコア(DS)を導入し、知識蒸留のダイナミクスを反映する。
  • EVSとDSの両方を学習可能な冷却戦略を用いて組み合わせる、適応的コアセット選択(ACS)フレームワークを設計する。
  • EVS(初期トレーニング)からDS(後期トレーニング)への注目をシフトさせる動的重み付けスキーム、$\beta(t)$を適用し、データの多様性と収束性を向上させる。
  • 2段階の選択プロセスを採用:全サンプルに対してEVSとDSを計算し、各エポックで重み付き組み合わせに基づき上位$k$個のサンプルを選択する。
  • $\beta(t)$にコサイン冷却を適用することで、初期から後期トレーニングへの優先順位の滑らかな移行を実現し、固定または線形スケジュールを上回る性能を発揮する。

実験結果

リサーチクエスチョン

  • RQ1量子化に配慮したトレーニング中に、サンプルの重要性はどのように変化するか? そして、勾配に基づく指標を用いて効果的に定量化可能か?
  • RQ2誤差ベクトルスコア(EVS)と不一致スコア(DS)を組み合わせることで、単独で使用する場合と比較して、QATにおけるコアセット選択の性能が向上するか?
  • RQ3EVSとDSの相対的重みをトレーニングエポックにわたってどのように調整すれば、QATの効率性と正確性を最大化できるか?
  • RQ4コアセット選択により、ImageNet-1KおよびCIFAR-100においてQATのデータ使用量をどの程度削減可能か? また、その際、モデル性能を維持または向上できるか?
  • RQ5QATにおけるコアセット選択の過程で、EVSとDSをバランスさせる最適な冷却戦略は何か?

主な発見

  • ACSは、ImageNet-1Kの4ビット量子化されたResNet-18に対して、トレーニングデータのたった10%を用いてもトップ1精度68.39%を達成した。これはランダム選択と比較して4.24%の絶対的向上である。
  • CIFAR-100における2ビット重みのみの量子化では、ACSはトレーニングデータの50%を用いて平均精度67.19%を達成し、ベースラインのコアセット手法を上回った。
  • コサイン冷却戦略を用いた$\beta(t)$は、固定、線形、平方根、2次関数スケジュールを上回る最良の性能を発揮した。
  • 不一致スコア(DS)の分布は時間経過とともに0に近づく傾向を示し、これはDSがモデルの収束状態と知識蒸留の進行状況を追跡する役割を果たしていることを確認した。
  • 可視化結果から、ACSを用いたQATは、ランダム選択やベースラインコアセット選択と比較して、滑らかでより集中した損失のランドスケープを生成することがわかった。
  • アブレーションスタディの結果、EVSとDSは相補的であることが確認された:EVSは小規模なデータ割合で優れた性能を発揮し、DSは大規模なデータ割合で性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。