[论文解读] Meta-Album: Multi-domain Meta-Dataset for Few-Shot Image Classification
Meta-Album 引入了一个大规模、多领域的元数据集,用于少样本图像分类,涵盖10个领域(如生态学、制造业和光学字符识别)的40个多样化数据集,每个领域至少包含20个类别,每个类别有40张图像。它提供三种可扩展的版本(微型、小型、扩展版),具有统一的格式、经验证的许可证,并可通过社区贡献实现可扩展性,从而实现在异构领域中对元学习和迁移学习算法进行真实场景的基准测试。
We introduce Meta-Album, an image classification meta-dataset designed to facilitate few-shot learning, transfer learning, meta-learning, among other tasks. It includes 40 open datasets, each having at least 20 classes with 40 examples per class, with verified licences. They stem from diverse domains, such as ecology (fauna and flora), manufacturing (textures, vehicles), human actions, and optical character recognition, featuring various image scales (microscopic, human scales, remote sensing). All datasets are preprocessed, annotated, and formatted uniformly, and come in 3 versions (Micro $\subset$ Mini $\subset$ Extended) to match users' computational resources. We showcase the utility of the first 30 datasets on few-shot learning problems. The other 10 will be released shortly after. Meta-Album is already more diverse and larger (in number of datasets) than similar efforts, and we are committed to keep enlarging it via a series of competitions. As competitions terminate, their test data are released, thus creating a rolling benchmark, available through OpenML.org. Our website https://meta-album.github.io/ contains the source code of challenge winning methods, baseline methods, data loaders, and instructions for contributing either new datasets or algorithms to our expandable meta-dataset.
研究动机与目标
- 解决少样本学习中缺乏多样化、真实且计算可行的元数据集的问题。
- 实现在反映现实世界分布偏移的跨领域设置中对元学习算法的基准测试。
- 创建一个可扩展的元数据集,支持轻量级、中等规模和大规模实验。
- 通过竞赛和开放贡献新数据集与算法,促进社区驱动的扩展。
- 通过在 OpenML.org 上发布竞赛测试集,提供滚动基准,确保长期实用性和可复现性。
提出的方法
- 该元数据集整合了来自10个不同领域(包括动物、植物、纹理、车辆和OCR)的40个预处理、标注并统一格式化的图像分类数据集。
- 数据集经过筛选,每个领域至少包含20个类别和每个类别40张图像,确保为少样本学习提供充足数据,同时保持规模和模态的多样性。
- 提供三种版本(微型、小型、扩展版),以适应不同的计算资源,数据量和覆盖范围逐步增加。
- 所有数据集均获得学术使用许可,许可证经验证并可通过项目官网和 OpenML.org 获取元数据。
- 建立了社区贡献流程,包括数据格式化和验证的代码,以及确保质量和一致性的审查流程。
- 该元数据集已集成至竞赛框架(NeurIPS 2021 和 2022),竞赛结束后发布测试集,形成在 OpenML 上的滚动基准。
实验结果
研究问题
- RQ1多领域元数据集是否能超越单领域基准,提升少样本学习算法的泛化评估能力?
- RQ2包含多样化领域和类别层次结构,对元学习模型的性能和鲁棒性有何影响?
- RQ3社区驱动、可扩展的元数据集在多大程度上能维持元学习研究中的长期基准实用性?
- RQ4跨领域统一预处理数据的可用性是否降低了新研究者进入少样本学习领域的门槛?
- RQ5不同数据规模(微型、小型、扩展版)对元学习模型的性能和训练效率有何影响?
主要发现
- Meta-Album 包含10个领域中的40个图像分类数据集,其中30个已立即提供,10个于2023年春季发布,其覆盖范围和多样性超过以往的元数据集。
- 微型版本包含40个数据集中的32,000张图像,每个领域19–20个类别,每个类别40张图像,总大小为380 MB,轻量化且易于访问。
- 小型版本扩展至40个数据集中的220,950张图像,每个领域类别数为19–706个,每个类别40张图像,总大小为3.9 GB,适用于大多数研究系统。
- 扩展版本包含150万张图像,类别数范围为19至706个,每类别图像数为1至187张,总大小为15 GB,支持大规模实验。
- Meta-Album 是唯一专为可扩展性设计的元数据集,配备开源工具和审查流程,支持持续的社区贡献新数据集和算法。
- NeurIPS 2021 和 2022 竞赛的测试数据已通过 OpenML.org 发布,形成随时间演进的滚动基准,支持可复现研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。