Skip to main content
QUICK REVIEW

[论文解读] Federated Active Learning (F-AL): an Efficient Annotation Strategy for Federated Learning

Jin-Hyun Ahn, Kyungsang Kim|arXiv (Cornell University)|Feb 1, 2022
Privacy-Preserving Technologies in Data参考文献 32被引用 4
一句话总结

本文提出联邦主动学习(F-AL),一种在联邦学习中减少标注成本的协作式主动学习策略,通过客户端协同选择最具信息量的样本进行标注。F-AL通过分布式的、协作的不确定性采样方法,在使用更少标注样本的情况下,提升了全局模型的准确率,优于随机采样和客户端独立主动学习(S-AL)。

ABSTRACT

Federated learning (FL) has been intensively investigated in terms of communication efficiency, privacy, and fairness. However, efficient annotation, which is a pain point in real-world FL applications, is less studied. In this project, we propose to apply active learning (AL) and sampling strategy into the FL framework to reduce the annotation workload. We expect that the AL and FL can improve the performance of each other complementarily. In our proposed federated active learning (F-AL) method, the clients collaboratively implement the AL to obtain the instances which are considered as informative to FL in a distributed optimization manner. We compare the test accuracies of the global FL models using the conventional random sampling strategy, client-level separate AL (S-AL), and the proposed F-AL. We empirically demonstrate that the F-AL outperforms baseline methods in image classification tasks.

研究动机与目标

  • 为解决现实联邦学习(FL)应用中标注成本过高的问题,其中标注往往是主要瓶颈。
  • 探究主动学习(AL)是否能有效整合到联邦学习框架中以减少标注工作量。
  • 设计一种协作式主动学习策略,在最小化客户端标注工作量的同时提升全局联邦学习模型性能。
  • 在联邦学习环境中,对比F-AL与随机采样和客户端独立主动学习(S-AL)的性能。

提出的方法

  • F-AL通过客户端协同识别最具信息量的样本用于标注,而非各自独立选择,从而实现协作式主动学习。
  • 该方法以分布式方式使用基于不确定性的采样策略(如不确定性采样、核心集、VAAL),客户端通过中央参数服务器共享模型更新和采样决策。
  • 客户端在其本地未标注数据上应用最先进的主动学习算法(如MCDAL、LL、核心集、VAAL),但最终的样本选择由全局模型的信息量指导。
  • 全局模型通过联邦平均(FedAvg)进行更新,主动学习过程迭代地基于客户端间计算的不确定性或代表性度量选择新样本。
  • 该框架通过确保采样决策不集中所有本地数据,强制满足联邦学习约束,从而保护隐私并提高通信效率。
  • F-AL采用分布式优化方法,在本地信息量与全局模型改进之间取得平衡,避免偏向于单个客户端的数据分布。

实验结果

研究问题

  • RQ1主动学习能否有效集成到联邦学习中以减少标注工作量?
  • RQ2在全局模型准确率方面,协作式主动学习(F-AL)与随机采样和客户端级独立主动学习(S-AL)相比表现如何?
  • RQ3F-AL是否在分布式联邦学习环境中相比孤立的客户端级主动学习提升了主动学习性能?
  • RQ4为何某些主动学习策略(如核心集、VAAL)在联邦学习中表现不佳,尽管其在集中式设置中表现优异?
  • RQ5F-AL在多大程度上缓解了联邦学习中每个客户端未标注数据有限导致的性能下降问题?

主要发现

  • F-AL在多个图像分类基准(包括Fashion-MNIST、CIFAR-10和CIFAR-100)上显著优于随机采样和S-AL,测试准确率更高。
  • F-AL在基于不确定性的主动学习方法(如不确定性采样、MCDAL、LL)上的性能提升最为显著,相比基线方法有显著改进。
  • F-AL在保持或提升全局模型准确率的同时,减少了所需标注样本的数量,证明了其在降低标注成本方面的有效性。
  • 核心集和VAAL方法在联邦学习中表现不佳,原因是每个客户端的未标注数据不足,但F-AL通过协作训练变分自编码器(VAE)和判别器,提升了VAAL的性能(F-VAAL)。
  • F-AL导致独立本地学习(IL)性能下降,因为客户端优先考虑全局模型改进而非本地数据集的信息量,导致客户端间采样存在偏差。
  • 尽管存在本地数据分布偏差,F-AL选择的聚合数据集仍实现了高全局模型准确率,证实了在联邦学习中协作采样策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。