Skip to main content
QUICK REVIEW

[论文解读] Re-thinking Federated Active Learning based on Inter-class Diversity

SangMook Kim, Sangmin Bae|arXiv (Cornell University)|Mar 22, 2023
Data Quality and ManagementDecision Sciences被引用 3
一句话总结

该论文提出LoGo,一种新颖的联邦主动学习(FAL)采样策略,通过整合仅本地和全局查询选择器,解决异构联邦学习设置中的类别不平衡问题。通过采用两步聚类选择机制——首先利用仅本地模型确保本地多样性,随后结合全局模型感知优化查询——LoGo在多样化数据分布下均表现出稳健性能,在38组实验设置中持续优于六种基线方法。

ABSTRACT

Although federated learning has made awe-inspiring advances, most studies have assumed that the client's data are fully labeled. However, in a real-world scenario, every client may have a significant amount of unlabeled instances. Among the various approaches to utilizing unlabeled data, a federated active learning framework has emerged as a promising solution. In the decentralized setting, there are two types of available query selector models, namely 'global' and 'local-only' models, but little literature discusses their performance dominance and its causes. In this work, we first demonstrate that the superiority of two selector models depends on the global and local inter-class diversity. Furthermore, we observe that the global and local-only models are the keys to resolving the imbalance of each side. Based on our findings, we propose LoGo, a FAL sampling strategy robust to varying local heterogeneity levels and global imbalance ratio, that integrates both models by two steps of active selection scheme. LoGo consistently outperforms six active learning strategies in the total number of 38 experimental settings.

研究动机与目标

  • 解决联邦主动学习(FAL)中的类别不平衡挑战,其中本地客户端数据与全局模型数据均可能表现出显著的类别偏移。
  • 探究在本地数据异质性与全局类别不平衡程度不同的情况下,两种查询选择器类型(全局模型与仅本地模型)的性能主导性差异。
  • 设计一种鲁棒的FAL采样策略,能够适应未知或变化的本地与全局数据不平衡程度,而无需事先掌握相关信息。
  • 开发一种方法,融合本地与全局模型的洞察,以提升去中心化学习中查询选择的效率与模型泛化能力。

提出的方法

  • 提出一种两阶段基于聚类的主动学习框架:在宏观阶段,利用仅本地模型生成的幻觉梯度空间进行k-means聚类,以确保本地类别间多样性。
  • 在微观阶段执行一次EM迭代:E步将样本分配至宏观阶段的聚类中,M步则利用全局模型从每个聚类中采样,优先选择全局少数类别。
  • 隐式整合本地与全局模型知识:仅本地模型捕捉客户端特定的数据分布,而全局模型捕捉全局数据不平衡。
  • 采用基于聚类的采样策略,在保守保持本地多样性的同时,通过全局模型引入对全局少数类别的关注。
  • 将狄利克雷分布浓度参数(α)作为本地异质性的代理指标,全局不平衡比(ρ)用于分析选择器的主导性。
  • 设计一种数据无关策略,无需预先知晓α或ρ,使其在多样化的现实联邦学习场景中具备鲁棒性。

实验结果

研究问题

  • RQ1在FAL中,全局与仅本地查询选择器的性能如何随本地异质性(α)与全局不平衡比(ρ)而变化?
  • RQ2能否设计一种统一的主动学习策略,有效结合全局与仅本地查询选择器在多样化数据分布场景下的优势?
  • RQ3融合本地与全局模型洞察在多大程度上提升了联邦主动学习中查询选择的质量与下游模型的准确率?
  • RQ4两步聚类采样策略是否优于简单平均或排序全局与本地模型预测结果的基线集成方法?
  • RQ5所提出的LoGo方法在多样化数据集与不同标注预算下,其测试准确率与收敛速度的鲁棒性如何?

主要发现

  • 全局与仅本地查询选择器在FAL中的优劣并非固定,而是取决于本地异质性(α)与全局不平衡比(ρ)之间的相互作用。
  • 当本地异质性较高(α较低)时,仅本地模型表现更优,因其能更好地检测每个客户端上少数类别的信息性样本。
  • 当全局不平衡程度较高(ρ较高)时,全局模型占据主导地位,因其能捕捉更广泛的数据分布,并可优先关注全局中代表性不足的类别。
  • LoGo在38组实验设置中始终取得最高测试准确率,显著优于六种基线方法,包括Entropy、BADGE、GCNAL与ALFA-Mix,在CIFAR-10、SVHN、PathMNIST与DermaMNIST上表现优异。
  • 在表3(α=0.1)中,LoGo在CIFAR-10上于80%标注预算下达到86.02%准确率,超过次优基线GCNAL(85.10%),并在SVHN上同样达到86.02%,全面超越所有其他方法。
  • 在表4中,LoGo显著优于三种简单集成方法(logit平均、基于排名的加权、微调),表明简单模型融合不足以替代LoGo中结构化的两步聚类集成机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。