Skip to main content
QUICK REVIEW

[論文レビュー] On The State of Data In Computer Vision: Human Annotations Remain Indispensable for Developing Deep Learning Models

Zeyad Emam, Andrew Kondrich|arXiv (Cornell University)|Jul 31, 2021
Advanced Neural Network Applications参考文献 72被引用数 7
ひとこと要約

この論文は、コンピュータビジョンにおける深層学習モデルの訓練における人間によるアノテーションデータの役割を調査し、自己教師あり学習や合成データの手法の進展にもかかわらず、最先端の性能を達成するには高品質な人間ラベル付きデータセットが不可欠であると結論づけている。本研究ではJFT-300M や Instagram-1B といった大規模データセットを分析し、顕著なラベルノイズが存在する中でも、人間によるアノテーションデータが合成代替品を上回る汎化性能と公平性を示していることを示している。

ABSTRACT

High-quality labeled datasets play a crucial role in fueling the development of machine learning (ML), and in particular the development of deep learning (DL). However, since the emergence of the ImageNet dataset and the AlexNet model in 2012, the size of new open-source labeled vision datasets has remained roughly constant. Consequently, only a minority of publications in the computer vision community tackle supervised learning on datasets that are orders of magnitude larger than Imagenet. In this paper, we survey computer vision research domains that study the effects of such large datasets on model performance across different vision tasks. We summarize the community's current understanding of those effects, and highlight some open questions related to training with massive datasets. In particular, we tackle: (a) The largest datasets currently used in computer vision research and the interesting takeaways from training on such datasets; (b) The effectiveness of pre-training on large datasets; (c) Recent advancements and hurdles facing synthetic datasets; (d) An overview of double descent and sample non-monotonicity phenomena; and finally, (e) A brief discussion of lifelong/continual learning and how it fares compared to learning from huge labeled datasets in an offline setting. Overall, our findings are that research on optimization for deep learning focuses on perfecting the training routine and thus making DL models less data hungry, while research on synthetic datasets aims to offset the cost of data labeling. However, for the time being, acquiring non-synthetic labeled data remains indispensable to boost performance.

研究の動機と目的

  • コンピュータビジョンにおけるデータの現状、特に深層学習モデルの訓練における人間によるアノテーションデータセットの役割を評価すること。
  • JFT-300M や Instagram-1B といった大規模ラベル付きデータセットでの事前学習が、下流タスクのパフォーマンスをどのように向上させるかを評価すること。
  • 大規模データセットにおけるラベルノイズの影響を調査し、それがモデルの汎化性能を損なうかどうかを検証すること。
  • 合成データや自己教師あり学習が人間によるアノテーションデータの代替として有効かどうかを検討すること。
  • 大規模で長尾分布かつ偏りのあるデータセットで学習することによる公平性への影響を検討し、合成データがこれらの問題を軽減できるかどうかを調査すること。

提案手法

  • JFT-300M(3億枚の画像、3億7500万件のノイズありラベル)、Instagram-1B(35億枚の画像)、YFCC-100M を含む主な公開および非公開のコンピュータビジョンデータセットを調査し、スケールとラベル品質を分析した。
  • ImageNet などの下流タスクで微調整された JFT-300M で事前学習したモデルのパフォーマンスを分析し、正確性の向上と汎化行動を測定した。
  • ラベルノイズの影響を評価するため、データセットにランダムなラベルを注入した(例:Instagram-1B で50%のハッシュタグを置き換え)、正確性の低下を測定した。
  • Patrini ら(2017)の損失補正やラベルスムージングなどのラベルノイズ対処技術を、Clothing1M などのデータセットに適用して評価した。
  • 生成モデル(例:GAN)を用いた合成データ生成技術を検討し、UCI Adult クイックスケールデータセットを実験用に使用して公平性の向上を試みた。
  • データセットサイズの増加に伴うモデル性能の二重降下現象およびサンプル非単調性を検証した。

実験結果

リサーチクエスチョン

  • RQ1JFT-300M や Instagram-1B といった大規模な人間によるアノテーションデータセットで学習したモデルは、小規模または合成データセットで学習したモデルに比べてどの程度優れているか?
  • RQ2大規模データセットにおけるラベルノイズがモデルの汎化性能に与える影響は何か? また、既存の補正技術はその影響を軽減できるか?
  • RQ3合成データが、複雑なビジョンタスクにおけるモデルの公平性とパフォーマンスの向上に有効に代替できるか?
  • RQ4大規模データセットでの事前学習と、高品質な小規模データセットでの微調整の間には、正確性と効率性の観点でどのようなトレードオフがあるか?
  • RQ5データセットのサイズとクラスの不均衡は、ディープラーニングモデルにおけるアルゴリズム的公平性にどのように影響するか?

主な発見

  • JFT-300M で事前学習したモデルは、ImageNet などの下流タスクで顕著なパフォーマンス向上を示し、大規模な人間ラベル付きデータの価値を裏付けた。
  • Instagram-1B で50%のハッシュタグをランダムに置き換えた場合、モデルの正確性が7.31%から14.29%低下した。これはノイズが顕著な負の影響を及ぼすことを示している。
  • JFT-300M では20%の誤差率という高いラベルノイズが存在したが、それでもモデルは強力な汎化性能を示した。これは、完璧でないラベルでも高品質な性能が達成可能である可能性を示唆している。
  • 損失補正手法を Clothing1M データセットに適用したところ、正確性が16.59%向上した。これは、適切な技術を用いることでラベルノイズの影響を軽減できる可能性を示している。
  • 生成モデルによる合成データ生成は、テーブル形式のデータ(例:UCI Adult)において公平性の向上に有望であることが示されたが、複雑で非構造的な画像データへの有効性は未検証であり、未解決のままである。
  • 本論文は、特に自律走行車両のような実世界のミッションクリティカルなアプリケーションにおいて、人間によるアノテーションデータが高パフォーマンスのディープラーニングモデルを訓練する上で不可欠であると結論づけている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。