[论文解读] Robust Federated Training via Collaborative Machine Teaching using Trusted Instances
本文提出 CoMT,一种协作式机器教学框架,通过在分布式代理间利用少量可信数据实例,识别并纠正系统性损坏的训练数据,从而提升联邦学习的鲁棒性。通过以隐私保护的方式联合优化数据选择与模型训练,CoMT 在合成数据集和真实世界数据集上均达到最先进性能,相比先前方法将训练时间减少逾 75%,同时提升模型准确率。
Federated learning performs distributed model training using local data hosted by agents. It shares only model parameter updates for iterative aggregation at the server. Although it is privacy-preserving by design, federated learning is vulnerable to noise corruption of local agents, as demonstrated in the previous study on adversarial data poisoning threat against federated learning systems. Even a single noise-corrupted agent can bias the model training. In our work, we propose a collaborative and privacy-preserving machine teaching paradigm with multiple distributed teachers, to improve robustness of the federated training process against local data corruption. We assume that each local agent (teacher) have the resources to verify a small portions of trusted instances, which may not by itself be adequate for learning. In the proposed collaborative machine teaching method, these trusted instances guide the distributed agents to jointly select a compact while informative training subset from data hosted by their own. Simultaneously, the agents learn to add changes of limited magnitudes into the selected data instances, in order to improve the testing performances of the federally trained model despite of the training data corruption. Experiments on toy and real data demonstrate that our approach can identify training set bugs effectively and suggest appropriate changes to the labels. Our algorithm is a step toward trustworthy machine learning.
研究动机与目标
- 解决联邦学习对系统性数据损坏的脆弱性问题,即损坏数据表现出自洽且难以检测。
- 开发一种隐私保护方法,使分布式代理能够在不共享原始数据的情况下协作提升模型鲁棒性。
- 将数据调优与模型训练统一为联合优化过程,以在存在损坏训练数据的情况下提升学习性能。
- 最小化传统机器教学方法中常见的计算成本与可扩展性限制。
- 实现在受限专家标注可信数据条件下的真实世界联邦设置中鲁棒机器学习的实用部署。
提出的方法
- 提出一种协作式机器教学框架,其中本地代理作为分布式教师,中央服务器作为学生,共同选择一个紧凑且信息丰富的训练子集。
- 使用少量专家验证的可信实例作为锚点,指导各代理间训练数据的选择与修正,确保与真实数据分布对齐。
- 构建一个联合优化问题,同时选择训练实例并以有界扰动方式修改其标签,以提升模型泛化能力。
- 采用共识优化,使分布式代理能够在不显式传输数据的情况下协作调优数据并训练模型,从而保护隐私。
- 将模型训练与数据修正整合到统一的目标函数中,确保在整个优化过程中与可信实例保持一致性。
- 应用带有自适应学习率(如 Nesterov 加速梯度)的增量更新,以提升收敛速度与稳定性。
实验结果
研究问题
- RQ1使用可信实例的协作式机器教学能否有效检测并纠正联邦学习中的系统性损坏训练数据?
- RQ2与非协作或孤立的数据修正方法相比,数据选择与模型训练的联合优化在提升鲁棒性方面有何优势?
- RQ3所提方法在保持或提升在损坏数据集上性能的同时,能在多大程度上降低计算成本?
- RQ4该框架是否通过避免原始数据传输,在保护隐私的同时实现了分布式代理间的有效协作?
- RQ5通过协作教学选择的训练子集的最优规模与构成是什么?其对模型泛化能力有何影响?
主要发现
- 在 CPUSMALL 回归数据集上,CoMT 仅使用 55% 的训练数据即达到 R 平方值 0.71,显著优于仅使用 TI(0.38)、DUTI(0.56)和 rLR(0.58)的方法。
- 在 IJCNN 二分类数据集上,CoMT 在标签翻转噪声下达到 AUC 0.73,优于所有基线方法(≤0.70),且在仅选择 55% 数据时仍保持高性能。
- CoMT 在回归任务上平均 1500 次迭代内收敛,在分类任务上为 2000 次,收敛行为与先前工作一致,表明结合自适应学习率后可能实现更快收敛。
- 该方法在数据规模上近乎线性可扩展:在 500,000 个实例上,回归任务耗时 384.32 秒,分类任务耗时 684.33 秒,展现出强大的计算可扩展性。
- 在所有实验中,CoMT 的运行时间均低于 DUTI 成本的 25%,证实其在大规模场景下的效率优势。
- 性能并未随选择数据量增加而单调提升,证实存在一个最优的紧凑训练子集,验证了协作教学的核心原则。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。