Skip to main content
QUICK REVIEW

[論文レビュー] CurriculumNet: Weakly Supervised Learning from Large-Scale Web Images

Sheng Guo, Weilin Huang|arXiv (Cornell University)|Aug 3, 2018
Machine Learning and Data Classification参考文献 27被引用数 21
ひとこと要約

CurriculumNetは、特徴空間の分布密度を用いてデータの複雑さをランク付けすることで、ノイズが多いラベルを伴う大規模なウェブ画像に対して、深層畳み込みニューラルネットワーク(CNN)を訓練するカリキュラム学習戦略を提案する。これは最先端の性能を達成し、WebVisionにおけるトップ5誤差を5.2%まで低下させ、先行手法よりも相対誤差を50%以上削減した。

ABSTRACT

We present a simple yet efficient approach capable of training deep neural networks on large-scale weakly-supervised web images, which are crawled raw from the Internet by using text queries, without any human annotation. We develop a principled learning strategy by leveraging curriculum learning, with the goal of handling a massive amount of noisy labels and data imbalance effectively. We design a new learning curriculum by measuring the complexity of data using its distribution density in a feature space, and rank the complexity in an unsupervised manner. This allows for an efficient implementation of curriculum learning on large-scale web images, resulting in a high-performance CNN model, where the negative impact of noisy labels is reduced substantially. Importantly, we show by experiments that those images with highly noisy labels can surprisingly improve the generalization capability of the model, by serving as a manner of regularization. Our approaches obtain state-of-the-art performance on four benchmarks: WebVision, ImageNet, Clothing-1M and Food-101. With an ensemble of multiple models, we achieved a top-5 error rate of 5.2% on the WebVision challenge for 1000-category classification. This result was the top performance by a wide margin, outperforming second place by a nearly 50% relative error rate. Code and models are available at: https://github.com/MalongTech/CurriculumNet .

研究の動機と目的

  • 大規模で弱教師ありのウェブ画像データセットに、多数のノイズを含むラベルを用いて深層畳み込みニューラルネットワーク(CNN)を訓練する課題に対処すること。
  • 人為的アノテーションを一切用いずに、カリキュラム学習を活用することで、モデルの汎化性能と性能を向上させること。
  • 非常にノイズの多いラベルが、モデルの性能を低下させるのではなく、向上させる可能性があるかどうかを検証すること。
  • 大規模でノイズの多いウェブデータに特化した、効率的で教師なしのカリキュラム戦略を開発すること。
  • WebVision、ImageNet、Clothing-1M、Food-101を含む複数のベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、特徴空間における分布密度を測定することで、サンプルの複雑さをランク付けする、新しいカリキュラム学習戦略を導入する。
  • クラスタリングに基づく密度推定を用いて、教師なしの方法で複雑さを計算し、容易な(低複雑さ)から難しい(高複雑さ)のサンプルを特定する。
  • 学習はカリキュラム順序に従い、低複雑さ(密度が高い)のサンプルから順次、より複雑なサンプルを含めて進める。
  • ノイズ除去やモデルの再訓練を必要とせず、学習プロセスそのものにノイズのあるデータを直接活用する。
  • 標準的なCNNアーキテクチャ(例:Inception-v2)を用いて、カリキュラムに基づくデータ順序に従い、モデルをからだから訓練する。
  • アンサンブル学習を適用することで、特にWebVisionチャレンジにおいて性能をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1大規模なウェブ画像データセットにおける多数のノイズラベルを、カリキュラム学習戦略が効果的に処理できるか?
  • RQ2訓練中に非常にノイズの多い画像を含めることで、モデルの汎化性能が低下するのではなく向上するのか?
  • RQ3特徴空間の密度に基づく教師なしの複雑さランク付けが、ヒューリスティック的または手動で設計されたカリキュラムよりも優れているか?
  • RQ4弱教師あり学習ベンチマークにおいて、CurriculumNetは最先端の手法と比較してどうか?
  • RQ5このカリキュラム戦略は、ノイズレベルが異なる多様なデータセットに一般化可能か?

主な発見

  • CurriculumNetはWebVision 2017チャレンジでトップ5誤差5.2%を達成し、2位の手法よりも相対誤差を約50%削減した。
  • WebVisionデータセットでは、ベースラインの14.2%からトップ5誤差を10.8%まで低下させ、CleanNet(12.2%)やMentorNet(12.0%)を上回った。
  • Clothing-1Mではトップ1正答率が18.5%に向上し、CleanNet(20.1%)やPatriniら(19.6%)を1.6~3.3ポイント上回った。
  • Food-101では、20%のランダムラベルを用いてもトップ1誤差12.7%を達成し、FoodNet(27.9%)やCleanNet(16.0%)を上回った。
  • WebVisionとImageNetのデータを組み合わせた場合、ImageNetのトップ5誤差を8.6%から7.1%まで低下させ、高いノイズ耐性とデータ効率性を示した。
  • モデルは、非常にノイズの多いラベルがカリキュラム学習スケジュールに組み込まれることで、正則化として機能し、汎化性能が向上することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。