[论文解读] DAF:re: A Challenging, Crowd-Sourced, Large-Scale, Long-Tailed Dataset For Anime Character Recognition
本文提出了 DAF:re,一个大规模、众包、长尾的数据集,包含 500K 幅动漫人脸,涵盖 3,000 个类别,旨在推动动漫角色识别的发展。实验表明,在小批量(64)和小图像(128×128)设置下,视觉变换器(ViT)优于残差网络(ResNet)等卷积神经网络(CNN),尤其是在微调后;而在大批量(1024)和大图像(224×224)条件下,CNN 表现更优。
In this work we tackle the challenging problem of anime character recognition. Anime, referring to animation produced within Japan and work derived or inspired from it. For this purpose we present DAF:re (DanbooruAnimeFaces:revamped), a large-scale, crowd-sourced, long-tailed dataset with almost 500 K images spread across more than 3000 classes. Additionally, we conduct experiments on DAF:re and similar datasets using a variety of classification models, including CNN based ResNets and self-attention based Vision Transformer (ViT). Our results give new insights into the generalization and transfer learning properties of ViT models on substantially different domain datasets from those used for the upstream pre-training, including the influence of batch and image size in their training. Additionally, we share our dataset, source-code, pre-trained checkpoints and results, as Animesion, the first end-to-end framework for large-scale anime character recognition: https://github.com/arkel23/animesion
研究动机与目标
- 为计算机视觉中的动漫角色识别解决缺乏大规模、多样化且长尾的数据集问题。
- 研究视觉变换器(ViT)在与其 ImageNet 预训练分布显著不同的领域中的泛化能力和迁移学习性能。
- 在图像尺寸和批量大小等不同超参数条件下,比较 ViT 与基于 CNN 的模型(如 ResNet)在动漫人脸分类任务中的表现。
- 发布一个完整的端到端框架 Animesion,包含代码、预训练模型和数据集,以加速动漫多媒体分析领域的研究。
提出的方法
- 将原始的 DanbooruAnimeFaces (DAF) 数据集重构为 DAF:re,一个众包、大规模、长尾的数据集,包含约 500K 张图像和 3,000 个类别。
- 从公开来源收集图像,并应用标准化预处理:将图像缩放至 160×160 或 256×256,随机裁剪至 128×128 或 224×224,并对数据增强进行随机水平翻转。
- 训练多种模型,包括 ResNet-18、ResNet-152 以及视觉变换器(ViT-B/16、ViT-B/32、ViT-L/16、ViT-L/32),并对比其在 ImageNet 预训练与未预训练条件下的表现。
- 使用带动量的随机梯度下降(初始初始学习率=0.001,每 20 个周期衰减为 1/3,共训练 50 个周期;或每 50 个周期衰减一次,共训练 200 个周期)。
- 在验证集和测试集上使用 top-1 和 top-5 准确率评估模型性能,推理阶段进行归一化处理且不使用数据增强。
- 发布数据集、代码、预训练模型以及 Animesion 框架,以支持研究可复现性与未来研究。
实验结果
研究问题
- RQ1在不同训练超参数条件下,视觉变换器(ViT)与 ResNet 等卷积神经网络(CNN)在动漫人脸识别中的表现如何?
- RQ2图像尺寸(128×128 与 224×224)和批量大小(64 与 1024)对 ViT 和 ResNet 模型在此下游任务中的性能有何影响?
- RQ3在像 DAF:re 这类长尾、风格化、手绘图像数据集上,ImageNet 预训练对 ViT 和 ResNet 模型的迁移学习性能有何影响?
- RQ4ViT 模型能否在与其预训练分布(自然图像)显著不同的领域(如动漫)中实现有效泛化?
- RQ5在大规模且长尾的数据集上,ViT 与基于 CNN 的模型之间存在哪些性能权衡?
主要发现
- 在小批量(64)和小图像(128×128)设置下,经过 ImageNet 预训练的 ViT 模型在 moeImouto 数据集上达到 92.80% 的 top-1 准确率,显著优于微调后的 ResNet-18(61.20%)和 ResNet-152(63.06%)。
- 在大批量(1024)和大图像(224×224)设置下,ResNet-18 达到 68.30% 的 top-1 准确率,而 ViT-B/32 仅达到 59.92% 的 top-1 准确率,表明在此条件下 CNN 占据主导地位。
- ViT-L/16 模型在 64 批量大小和 128×128 输入下于 DAF:re 上达到 94.23% 的 top-5 准确率,表明在有利的超参数设置下具有强大的泛化能力。
- 预训练显著提升了 ViT 的性能:ViT-B/16 在预训练条件下于 moeImouto 上达到 91.57% 的 top-1 准确率(未预训练时为 67.28%);而 ResNet-18 在相同条件下从 72.58% 下降至 61.20%。
- ViT 与 CNN 模型之间的性能差距对超参数极为敏感:当批量大小较小时且图像尺寸较小时,ViT 表现优于 CNN;但当批量大小较大且图像尺寸较大时,ViT 表现反而更差。
- 即使未进行预训练,ViT-B/16 在 64 批量大小和 128×128 输入下于 DAF:re 上仍达到 82.14% 的 top-1 准确率,表明其在该领域具有强大的归纳偏差或模型容量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。