[論文レビュー] Will Large-scale Generative Models Corrupt Future Datasets?
本稿では、StableDiffusionを用いて画像生成を模擬することで、将来のコンピュータビジョンデータセットに大規模な生成画像が与える影響を調査している。実験の結果、分類、キャプション生成、画像生成の複数のタスクにおいて、生成画像が下流モデルの性能を低下させることを示しており、特に高濃度の汚染下ではImageNetで最大5.9%の性能低下が見られた。これは、生成モデルの出力がフィルタリングされない場合、データセットの品質とモデルの頑健性を損なう可能性があることを示唆している。
Recently proposed large-scale text-to-image generative models such as DALL$\cdot$E 2, Midjourney, and StableDiffusion can generate high-quality and realistic images from users' prompts. Not limited to the research community, ordinary Internet users enjoy these generative models, and consequently, a tremendous amount of generated images have been shared on the Internet. Meanwhile, today's success of deep learning in the computer vision field owes a lot to images collected from the Internet. These trends lead us to a research question: " extbf{will such generated images impact the quality of future datasets and the performance of computer vision models positively or negatively?}" This paper empirically answers this question by simulating contamination. Namely, we generate ImageNet-scale and COCO-scale datasets using a state-of-the-art generative model and evaluate models trained with "contaminated" datasets on various tasks, including image classification and image generation. Throughout experiments, we conclude that generated images negatively affect downstream performance, while the significance depends on tasks and the amount of generated images. The generated datasets and the codes for experiments will be publicly released for future research. Generated datasets and source codes are available from \url{https://github.com/moskomule/dataset-contamination}.
研究の動機と目的
- インターネットから収集される将来のデータセットが、大規模な生成画像によって汚染される可能性があるかどうかを調査すること。
- StableDiffusionからの高精細な生成画像でImageNetおよびCOCOの実画像を置き換えることで、データセット汚染を模擬すること。
- 複数のビジョンタスクにおける、汚染されたデータセットで訓練されたモデルの下流性能を評価すること。
- 性能低下の根本的原因を分析し、研究者およびモデル発行者に向けた緩和戦略を提案すること。
- 生成モデルにおける透かしの導入とデータセットキュレーションにおけるフィルタリングを提唱し、研究の整合性を保つこと。
提案手法
- ImageNetのカテゴリーやCOCOのキャプションを条件として、StableDiffusionを用いて300万枚の画像を生成し、大規模なデータセット汚染を模擬した。
- 実画像を生成画像で置き換えることで、ImageNetおよびCOCOの汚染版を、それぞれ20%、40%、80%の比率で作成した。
- 画像分類、画像キャプション生成、画像生成のタスクにおいて、汚染されたデータセットからモデルを再訓練した。
- 標準ベンチマークを用いてモデル性能を評価した:ImageNetではトップ-1正解率、COCOキャプションではBLEUおよびCIDErスコア、画像生成ではFIDスコアを用いた。
- MAE特徴量に対する線形プローブを適用し、汚染下での表現品質を評価し、一般化性能およびOOD(分布外)耐性を測定した。
- モデルの分布外入力に対する頑健性を分析し、標準的手法を用いて生成画像の検出可能性を評価した。

実験結果
リサーチクエスチョン
- RQ1ImageNetおよびCOCOが生成画像で汚染された場合、下流の画像分類性能にどのような影響を与えるか?
- RQ2生成画像は、画像キャプション生成および画像生成タスクの性能をどの程度低下させるか?
- RQ3生成画像が視覚的高精細性と合成評価における高いカバー率を示しても、なぜモデル性能が低下するのか?
- RQ4自己教師あり学習手法(例:MAE)は、汚染されたデータセットの悪影響を緩和できるか?
- RQ5現代の生成画像はどの程度検出可能か?また、データセットキュレーションおよびモデルの公平性にどのような影響を及えるか?
主な発見
- ImageNetにおける画像分類の正解率は、学習データの80%が生成画像に置き換えられた場合、42.5%に低下し、ベースラインから1.4%低下した。
- 性能低下は画像生成タスクで最も顕著で、80%の生成画像で学習した場合、FIDスコアが20.5ポイント上昇した。
- MAE特徴量の線形プローブにより、自己教師あり表現学習が汚染の影響を部分的に緩和できることを示した。汚染された特徴量でも高い正解率を維持した。
- 汚染されたデータで訓練されたモデルは、分布外入力に対して耐性が低下しており、一般化性能が損なわれていることが示された。
- 最新の生成モデル(例:StableDiffusion)からの生成画像を識別するための単純な検出手法は失敗し、高度な検出技術の必要性が浮き彫りになった。
- 本研究では、生成モデルが実データの分布モードを実データほど多く捉えていないことが判明した。これは、視覚的高品質さにもかかわらず性能低下が生じる要因である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。