Skip to main content
QUICK REVIEW

[论文解读] FLAIR: Federated Learning Annotated Image Repository

Congzheng Song, Filip Granqvist|arXiv (Cornell University)|Jul 18, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

FLAIR 是一个大规模、多标签图像数据集,包含来自 51,414 名真实 Flickr 用户的 429,078 幅图像,旨在在长尾标签分布、用户数据异构性以及特征偏移等现实条件下评估联邦学习。本文提出了集中式、联邦式以及差分隐私学习的可复现基线,表明在联邦学习和隐私设置下,由于数据不平衡和噪声,罕见类别上的模型性能显著下降。

ABSTRACT

Cross-device federated learning is an emerging machine learning (ML) paradigm where a large population of devices collectively train an ML model while the data remains on the devices. This research field has a unique set of practical challenges, and to systematically make advances, new datasets curated to be compatible with this paradigm are needed. Existing federated learning benchmarks in the image domain do not accurately capture the scale and heterogeneity of many real-world use cases. We introduce FLAIR, a challenging large-scale annotated image dataset for multi-label classification suitable for federated learning. FLAIR has 429,078 images from 51,414 Flickr users and captures many of the intricacies typically encountered in federated learning, such as heterogeneous user data and a long-tailed label distribution. We implement multiple baselines in different learning setups for different tasks on this dataset. We believe FLAIR can serve as a challenging benchmark for advancing the state-of-the art in federated learning. Dataset access and the code for the benchmark are available at \url{https://github.com/apple/ml-flair}.

研究动机与目标

  • 通过创建反映真实世界数据异构性和规模的数据集,解决联邦学习领域缺乏真实、大规模图像数据集的问题。
  • 提供一个基准,用于评估在非独立同分布数据、长尾标签分布以及差分隐私等实际挑战下的联邦学习模型。
  • 通过标准化的度量和训练设置,支持对联邦学习中隐私-效用-效率权衡的系统性评估。
  • 通过具备真实世界数据特征的分布式设置,支持对类别不平衡、少样本学习以及噪声鲁棒训练的研究。

提出的方法

  • 从 51,414 名真实 Flickr 用户中精选 429,078 幅图像,确保用户级别的数据分布多样化,并实现真实的用户划分。
  • 采用两级标签层次结构对图像进行标注:17 个粗粒度类别和 1,628 个细粒度类别,支持多层级基准测试。
  • 实施多种训练设置:集中式学习、标准联邦学习以及带有中央差分隐私的联邦学习。
  • 在联邦训练过程中对模型更新应用差分隐私,以评估隐私-效用权衡。
  • 使用 ResNet18 作为基础模型架构,并通过验证集和测试集上的平均精度均值(mAP)评估性能。
  • 通过 GitHub 提供开源代码和数据集访问,以确保可复现性并促进社区采纳。

实验结果

研究问题

  • RQ1在真实、异构的图像数据集上,不同学习范式(集中式、联邦式、差分隐私)下的模型性能如何变化?
  • RQ2用户划分数据中的标签不平衡和数据异构性在多大程度上会降低联邦学习中的模型性能?
  • RQ3差分隐私在联邦学习中如何影响模型准确率,特别是在罕见和细粒度类别上?
  • RQ4预训练模型(如 ImageNet)是否能提升联邦设置中长尾、细粒度分类任务的性能?
  • RQ5在该数据集上,不同差分隐私联邦学习中的群体规模和噪声尺度如何影响模型收敛性和准确率?

主要发现

  • 在 1,628 个细粒度类别的分类体系中,模型性能显著低于 17 个粗粒度类别的分类体系,其中验证集/测试集中的 11 个类别在训练过程中完全未出现。
  • 在训练集中,1,628 个细粒度类别中有 134 个类别正样本少于 20 个,这对集中式和联邦学习都构成了挑战。
  • 差分隐私加剧了罕见类别上的性能下降,原因在于稀疏梯度中信号与噪声比过低,尤其在联邦设置中更为明显。
  • 在差分隐私联邦学习中,更大的群体规模可减少噪声并提高模型准确率,但会增加训练延迟。
  • 在联邦学习中,低频类别的性能劣于集中式学习,凸显了数据异构性和隐私机制的叠加影响。
  • FLAIR 中的长尾标签分布使其成为推进少样本和零样本联邦学习研究的合适基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。