Skip to main content
QUICK REVIEW

[論文レビュー] Positive-Congruent Training: Towards Regression-Free Model Updates

Sijie Yan, Yuanjun Xiong|arXiv (Cornell University)|Nov 18, 2020
Adversarial Robustness in Machine Learning参考文献 36被引用数 5
ひとこと要約

本論文は、Focal Distillation(参照モデルによって正しく分類されたサンプルを優先的に重み付けする、重み付き distillation 損失)を用いて、古いモデルが正しく予測するサンプルが新しいモデルで誤りとなる「負のフリップ」を最小化することで、AI モデルの更新における回帰を低減するための Positive-Congruent Training (PCT) を導入する。この手法は、正確性に影響を与えることなく、負のフリップ率を最大で 30% 減少させ、参照モデルをアンサンブル化することで、性能を維持したまま適合性をさらに向上させる。

ABSTRACT

Reducing inconsistencies in the behavior of different versions of an AI system can be as important in practice as reducing its overall error. In image classification, sample-wise inconsistencies appear as "negative flips": A new model incorrectly predicts the output for a test sample that was correctly classified by the old (reference) model. Positive-congruent (PC) training aims at reducing error rate while at the same time reducing negative flips, thus maximizing congruency with the reference model only on positive predictions, unlike model distillation. We propose a simple approach for PC training, Focal Distillation, which enforces congruence with the reference model by giving more weights to samples that were correctly classified. We also found that, if the reference model itself can be chosen as an ensemble of multiple deep neural networks, negative flips can be further reduced without affecting the new model's accuracy.

研究の動機と目的

  • 古いモデルが正しく分類するサンプルに対して、新しいモデルが誤りを生じる「モデル更新における回帰」を是正すること。
  • 参照モデルの正しく予測された結果を維持する「正の適合性」を、モデル更新中に形式化すること。
  • 誤差率を増加させることなく、負のフリップ率を最小化する実用的な新しいモデルの訓練手法を開発すること。
  • アンサンブル化された参照モデルが、その後の更新における回帰を低減できるかどうかを検討すること。

提案手法

  • 参照モデルによって正しく分類されたサンプルに高い重みを割り当てる、知識蒸留の変種である Focal Distillation (FD) を提案。
  • 正の適合性を持つサンプルに重点を置くように変更された蒸留損失を導入し、負のフリップの発生確率を低下させる。
  • 標準分類損失とフォーカル蒸留損失を組み合わせた重み付き交差エントロピー損失を用い、正確性と適合性のバランスをとる。
  • ディープアンサンブルからの不確実性推定を用いて、予測の信頼性と負のフリップの関係を分析。
  • 後続の更新における負のフリップを低減するために、アンサンブルモデルを参照モデルとして使用する可能性を検討。
  • PCT を用いずに訓練した新規モデルと比較するため、PCT を用いた訓練とそうでない訓練を、訓練エポックにわたって実施。

実験結果

リサーチクエスチョン

  • RQ1モデル更新中に全体の誤差率を増加させることなく、負のフリップ率を低減できる訓練手法を設計できるか?
  • RQ2参照モデルにおける正しさに基づいてサンプルに重みを付けることで、新しいモデルにおける適合性が向上するか?
  • RQ3アンサンブル化された参照モデルは、推論時にアンサンブルを使用しない場合でも、その後の更新における負のフリップ率を低減できるか?
  • RQ4訓練プロセス中に、標準訓練と PCT の間で負のフリップ率の推移はどのように異なるか?
  • RQ5予測の不確実性と、サンプルが負のフリップに転じる確率との間に相関があるか?

主な発見

  • Focal Distillation は、標準訓練と比較して負のフリップ率(NFR)を最大で 30% 減少させ、誤差率への影響は最小限にとどまる。
  • ImageNet-ILSVRC12 では、Focal Distillation を用いることで NFR が 23.65%(処理なし)から 2.85%(FD-LM)に低下し、誤差率は 28.45% を維持する。
  • 参照モデルをアンサンブル化することで、NFR は 2.75%、誤差率は 26.39% に低下し、将来の PCT 評価にふさわしいパラドックス的水準の性能を示す。
  • 訓練過程において、負のフリップ率は誤差率と同時に変化するが、Focal Distillation は初期エポックから相対的 NFR のギャップを形成・維持する。
  • 負のフリップに転じるサンプルが一貫して高い不確実性を示すとは限らず、不確実性のみでは負のフリップを信頼性高く予測できない。
  • Focal Distillation を用いることで、初期訓練段階で相対的 NFR が早く低下し、訓練終了までそのギャップが持続する。これは、参照モデルとの早期適合が有効であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。