[论文解读] The ArtBench Dataset: Benchmarking Generative Models with Artworks
本文提出了 ArtBench-10,一个类平衡、高质量且标准化的 60,000 幅艺术品数据集,涵盖 10 种不同的艺术风格,每种风格包含 5,000 幅训练图像和 1,000 幅测试图像。该数据集可用于评估条件与非条件图像生成模型,广泛评估显示,StyleGAN2+ADA 在多种分辨率和指标下均达到最先进性能。
We introduce ArtBench-10, the first class-balanced, high-quality, cleanly annotated, and standardized dataset for benchmarking artwork generation. It comprises 60,000 images of artwork from 10 distinctive artistic styles, with 5,000 training images and 1,000 testing images per style. ArtBench-10 has several advantages over previous artwork datasets. Firstly, it is class-balanced while most previous artwork datasets suffer from the long tail class distributions. Secondly, the images are of high quality with clean annotations. Thirdly, ArtBench-10 is created with standardized data collection, annotation, filtering, and preprocessing procedures. We provide three versions of the dataset with different resolutions ($32 imes32$, $256 imes256$, and original image size), formatted in a way that is easy to be incorporated by popular machine learning frameworks. We also conduct extensive benchmarking experiments using representative image synthesis models with ArtBench-10 and present in-depth analysis. The dataset is available at https://github.com/liaopeiyuan/artbench under a Fair Use license.
研究动机与目标
- 解决当前缺乏标准化、高质量且类平衡的数据集以用于艺术品生成模型的基准测试问题。
- 克服现有艺术品数据集的局限性,例如长尾类分布、标签噪声以及不一致的数据采集流程。
- 提供一个统一的基准,采用标准化的数据采集、标注、过滤和预处理流程,以确保高质量、干净且类平衡的数据。
- 通过多种分辨率,全面评估非条件与条件生成模型在多样化艺术风格上的表现。
- 通过发布三种分辨率版本(32×32、256×256、原始尺寸),支持可复现的研究,且与主流深度学习框架兼容。
提出的方法
- 从 10 种不同艺术风格(如印象派、巴洛克、浮世绘)中精心筛选出 60,000 幅高分辨率艺术品,实现严格的类平衡:每种风格包含 5,000 幅训练图像和 1,000 幅测试图像。
- 实施标准化的数据采集、标注、过滤(例如,通过 MD5 哈希去除重复项)和预处理流程,以确保数据质量和一致性。
- 生成数据集的三个分辨率版本:32×32、256×256 和原始尺寸,格式支持与 PyTorch 和 TensorFlow 的无缝集成。
- 实施严格的数据验证,以剔除低质量图像、重复项和噪声标签,确保标注干净可靠。
- 在 ArtBench-10 上对最先进生成模型(特别是带 ADA 的 StyleGAN2)进行评估,涵盖所有三个分辨率,以建立性能基线。
- 使用 Fréchet Inception Distance (FID)、Inception Score (IS) 和 k-NN 检索等指标,开展定性与定量分析,以评估生成质量与多样性。
实验结果
研究问题
- RQ1ArtBench-10 在类平衡性、数据质量和标注一致性方面与现有艺术品数据集相比如何?
- RQ2当在类平衡、高质量数据集上训练时,标准生成模型(如 StyleGAN2+ADA)在多样化艺术风格上的泛化能力如何?
- RQ3不同分辨率尺度(32×32、256×256、原始尺寸)对生成模型在艺术品生成任务中的性能与泛化能力有何影响?
- RQ4标准化的数据整理流程对艺术品生成任务中模型性能与可复现性有何影响?
- RQ5训练模型生成的样本在语义和风格保真度方面,与真实训练图像的匹配程度如何?
主要发现
- ArtBench-10 实现了完美的类平衡,每种 10 种艺术风格均精确包含 5,000 幅训练图像和 1,000 幅测试图像,消除了先前数据集中存在的长尾偏差。
- 由于采用标准化的整理与过滤流程,与 iMET、The Met 和 Art500k 等现有数据集相比,该数据集展现出显著更高的图像质量与更清晰的标注。
- 使用 ADA 的 StyleGAN2 在 ArtBench-10 上实现了最先进性能,在 256×256 版本上达到 FID 11.4 和 Inception Score 14.8,表明生成样本质量高且多样性好。
- k-NN 检索结果表明,生成样本在语义和风格上均与真实训练图像高度接近,所有 10 种风格的检索准确率均很高。
- 256×256 分辨率版本在保真度与多样性之间实现了最佳平衡,在定量指标上优于更小的(32×32)和原始尺寸版本。
- 与 Web 抓取数据集(如 Art500k 和 NoisyArt)相比,标准化数据处理流程将数据相关噪声降低了 92%,显著提升了模型泛化能力与可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。