Skip to main content
QUICK REVIEW

[論文レビュー] Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks

Hao Chen, Jindong Wang|arXiv (Cornell University)|Sep 29, 2023
Aerospace and Aviation Technology被引用数 4
ひとこと要約

本論文は、事前学習データセットにおけるラベルノイズが微細調整後の性能に与える影響を調査し、わずかなノイズがドメイン内一般化を向上させる一方で、特徴空間の歪みにより一貫してドメイン外性能を低下させることを明らかにした。これを是正するため、著者らは特徴空間のアフィン変換を実現する軽量なブラックボックスチューニング手法NMTuneを提案した。この手法は共分散および特異値正則化を用い、完全な微細調整を必要とせずにドメイン内およびドメイン外の両方のタスクで一般化性能を著しく向上させる。

ABSTRACT

Pre-training on large-scale datasets and then fine-tuning on downstream tasks have become a standard practice in deep learning. However, pre-training data often contain label noise that may adversely affect the generalization of the model. This paper aims to understand the nature of noise in pre-training datasets and to mitigate its impact on downstream tasks. More specifically, through extensive experiments of supervised pre-training models on synthetic noisy ImageNet-1K and YFCC15M datasets, we demonstrate that while slight noise in pre-training can benefit in-domain (ID) transfer performance, where the training and testing data share the same distribution, it always deteriorates out-of-domain (OOD) performance, where training and testing data distribution are different. We empirically verify that the reason behind is noise in pre-training shapes the feature space differently. We then propose a light-weight black-box tuning method (NMTune) to affine the feature space to mitigate the malignant effect of noise and improve generalization on both ID and OOD tasks, considering one may not be able to fully fine-tune or even access the pre-trained models. We conduct practical experiments on popular vision and language models that are pre-trained on noisy data for evaluation of our approach. Our analysis and results show the importance of this interesting and novel research direction, which we term Noisy Model Learning.

研究の動機と目的

  • 事前学習データセットにおけるラベルノイズがドメイン内およびドメイン外タスクにおける微細調整後のモデル一般化性能に与える影響を理解すること。
  • ラベルノイズがドメイン内での利点を示す一方で、なぜドメイン外性能を低下させるのかを解明すること。
  • 事前学習ノイズによって引き起こされる特徴空間の歪みを是正する軽量でブラックボックスなチューニング手法を開発すること。
  • 事前学習モデルへのアクセスや完全な微細調整なしに、ドメイン内およびドメイン外の両方の下流タスクでの一般化性能を向上させること。
  • 耐障害性のある事前学習と転移学習のための新規研究分野、すなわち「ノイジーモデル学習」を確立すること。

提案手法

  • 著者らは、ImageNet-1KおよびYFCC15Mの合成的ノイズ版を用いて、ラベルノイズが事前学習に与える影響を広範に分析する実験を実施した。
  • NMTuneを提案し、ReLU活性化関数を備えた2層MLPを用いて特徴空間にアフィン変換を適用する軽量なチューニング手法である。
  • NMTuneは3つの正則化項を組み込む:平均二乗誤差(MSE)損失、共分散正則化(L_COV)、主要特異値正則化(L_SVD)。
  • ノイズの影響を低減するため、特徴空間をより綺麗で一般化性の高い分布に近づけるように最適化する。
  • 本手法はブラックボックス設計であり、事前学習モデルの推論時アクセスのみを必要とし、完全な微細調整を不要とする。
  • 本手法は、ノイズのあるデータで事前学習された視覚および言語モデル(ResNet-50およびViTなど)を対象に評価された。
(a) ID
(a) ID

実験結果

リサーチクエスチョン

  • RQ1事前学習データにおけるラベルノイズがドメイン内およびドメイン外の下流性能に与える影響は何か?
  • RQ2ラベルノイズがドメイン内性能を向上させる一方で、なぜドメイン外一般化性能を低下させるのか?
  • RQ3軽量でブラックボックスなチューニング手法が、事前学習ノイズによって引き起こされる特徴空間の歪みを効果的に是正できるか?
  • RQ4提案手法が完全な微細調整を必要とせずに、ドメイン内およびドメイン外タスクの両方で一般化性能を向上させられるか?
  • RQ5下流データに対してもノイズが存在する場合でも、本手法は有効に機能するか?

主な発見

  • 事前学習段階でのわずかなラベルノイズはドメイン内転移性能を向上させるが、特徴空間の歪みにより一貫してドメイン外性能を低下させる。
  • ノイズのある事前学習下では特徴空間が整合性を失い、分布シフト下での一般化性能に悪影響を及ける。
  • NMTuneはドメイン内およびドメイン外タスクの両方で一般化性能を向上させ、特にクリーンな事前学習モデルを用いた場合には標準的な微細調整(LP)を上回る性能を示す。
  • CIFAR-10およびCIFAR-100(それぞれ5%および10%のラベルノイズ)において、ImageNet-1Kで事前学習されたResNet-50では、NMTuneは75.06%および67.34%の精度を達成し、一部の設定でLPを上回った。
  • アブレーションスタディにより、ReLU非線形性および2層MLPアーキテクチャが最適であることが確認され、正則化項を削除すると性能が低下した。
  • 実行時間解析では、NMTuneは計算コストを最小限に抑え、言語のドメイン外タスクにおいて平均1.45 GPU時間(MLPチューニングの1.34時間と比較)を要した。
(b) OOD
(b) OOD

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。