[論文レビュー] Weakly Supervised Learning with Side Information for Noisy Labeled Images
本稿では、画像付加情報(例:キャプション、タグ)を活用して、大規模でノイズの多いウェブ画像における深層畳み込みニューラルネットワーク(CNN)の学習を向上させる弱教師付き学習フレームワーク、SINetを提案する。視覚的プロトタイプとノイズ重み付けモジュールを統合することで、誤ってラベル付けされた画像を効果的に特定・低減し、WebVision、ImageNet、Clothing-1M、および新しく公開された250万枚以上の細分化された製品画像を含むAliProductsデータセットにおいて、最先端の性能を達成した。
In many real-world datasets, like WebVision, the performance of DNN based classifier is often limited by the noisy labeled data. To tackle this problem, some image related side information, such as captions and tags, often reveal underlying relationships across images. In this paper, we present an efficient weakly supervised learning by using a Side Information Network (SINet), which aims to effectively carry out a large scale classification with severely noisy labels. The proposed SINet consists of a visual prototype module and a noise weighting module. The visual prototype module is designed to generate a compact representation for each category by introducing the side information. The noise weighting module aims to estimate the correctness of each noisy image and produce a confidence score for image ranking during the training procedure. The propsed SINet can largely alleviate the negative impact of noisy image labels, and is beneficial to train a high performance CNN based classifier. Besides, we released a fine-grained product dataset called AliProducts, which contains more than 2.5 million noisy web images crawled from the internet by using queries generated from 50,000 fine-grained semantic classes. Extensive experiments on several popular benchmarks (i.e. Webvision, ImageNet and Clothing-1M) and our proposed AliProducts achieve state-of-the-art performance. The SINet has won the first place in the classification task on WebVision Challenge 2019, and outperformed other competitors by a large margin.
研究の動機と目的
- 大規模なウェブ画像において、著しくノイズの多いラベルを有する深層CNNの学習に取り組むこと。
- クリーンなアノテーションを必要とせずに、画像関連の付加情報(例:キャプション、タグ)を活用してモデルのロバスト性を向上させること。
- 現実世界のデータセットにおけるラベルノイズの悪影響を軽減するスケーラブルな弱教師付き手法を開発すること。
- 5万ものセマンティッククラスと階層的なカテゴリ関係を持つ、大規模で細分化された製品データセット(AliProducts)を公開し、今後の研究を支援すること。
提案手法
- SINetは、ノイズの多い画像と付加情報を統合することで、各クラスごとにクリーンで代表的な特徴を学習する視覚的プロトタイプモジュールを備える。
- ノイズ重み付けモジュールは、画像の深層特徴と視覚的プロトタイプを比較することで、各画像の信頼度スコアを推定し、画像の順序付けと選択的学習を可能にする。
- クリーンラベルに依存せずに、弱教師付き学習の目的関数を用いて視覚的プロトタイプとノイズ重みを同時に最適化する。
- テキスト記述や階層的なクラス関係といった付加情報を用いて、クラス間および画像間の関係をモデル化し、プロトタイプの質を向上させる。
- 階層的カテゴリデータからクラス関係グラフを構築し、プロトタイプ学習とノイズ推定をガイドする。
- 信頼度重み付きサンプル上で交差エントロピー損失を用いて、エンドツーエンドに訓練することで、ノイズの多いデータに対する一般化性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1キャプションやタグなどの付加情報は、ノイズの多いウェブ画像における深層学習モデルの性能向上に効果的に活用できるか?
- RQ2クリーンな教師信号を用いずに、ノイズの多い画像から各クラスを代表するロバストな視覚的プロトタイプを学習できるか?
- RQ3特徴とプロトタイプの整合性に基づくノイズ重み付け機構は、現実世界のノイズの多いデータセットにおけるモデル精度を向上させられるか?
- RQ4提案手法は、著しくラベルノイズが強い大規模ベンチマークにおいて、既存の最先端手法を上回る性能を示せるか?
- RQ5本手法は、複雑なカテゴリ階層を持つ細分化された大規模製品認識タスクにも一般化可能か?
主な発見
- WebVision1.0では73.8%のトップ1正答率を達成し、40%のラベルノイズ下でもベースラインのResNet50や先行手法を上回った。
- Clothing1Mでは5万枚のクリーン画像を用いて81.32%の正答率を達成し、CleanNet(79.9%)、MetaCleaner(80.78%)、DeepSelf(81.16%)を上回った。
- 250万枚以上の画像と5万の細分化されたクラスを有する新規公開データセットAliProductsでは、86.29%の正答率を達成し、すべてのベースラインを上回った。
- WebVision Challenge 2019の5000カテゴリ分類タスクで1位を獲得し、実世界での強力な性能を示した。
- ノイズ重み付けモジュールは、信頼度に基づいて画像を順序付けし、高品質なサンプルに注目させ、誤ってラベル付けされたデータの影響を低減した。
- 付加情報と視覚的プロトタイプの統合により、特に細分化された設定やノイズの多い環境において、モデルのロバスト性が顕著に向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。