[论文解读] FedSDG-FS: Efficient and Secure Feature Selection for Vertical Federated Learning
FedSDG-FS 提出了一种用于纵向联邦学习(VFL)的隐私保护且高效的特征选择框架,采用高斯随机对偶门和部分同态加密(PHE)。该方法实现了准确、自适应的特征选择,仅需两次参数传输,显著降低了通信开销,在模型准确性和稳定性方面优于现有方法,同时保护了数据和标签隐私。
Vertical Federated Learning (VFL) enables multiple data owners, each holding a different subset of features about largely overlapping sets of data sample(s), to jointly train a useful global model. Feature selection (FS) is important to VFL. It is still an open research problem as existing FS works designed for VFL either assumes prior knowledge on the number of noisy features or prior knowledge on the post-training threshold of useful features to be selected, making them unsuitable for practical applications. To bridge this gap, we propose the Federated Stochastic Dual-Gate based Feature Selection (FedSDG-FS) approach. It consists of a Gaussian stochastic dual-gate to efficiently approximate the probability of a feature being selected, with privacy protection through Partially Homomorphic Encryption without a trusted third-party. To reduce overhead, we propose a feature importance initialization method based on Gini impurity, which can accomplish its goals with only two parameter transmissions between the server and the clients. Extensive experiments on both synthetic and real-world datasets show that FedSDG-FS significantly outperforms existing approaches in terms of achieving accurate selection of high-quality features as well as building global models with improved performance.
研究动机与目标
- 为解决纵向联邦学习(VFL)中缺乏高效且安全的特征选择方法,且无需事先了解噪声特征或有用特征的数量。
- 实现在整个训练和选择过程中,数据和标签始终保留在其原始所有者处的隐私保护型特征选择。
- 通过最小化参数传输次数和嵌入向量大小,降低 VFL 中的通信和计算开销。
- 通过在联合训练过程中准确识别并选择高质量、上下文相关的特征,提升全局模型性能。
- 设计一种稳定且自适应的特征选择机制,确保在不同选择特征数量和训练轮次下均保持高模型准确率。
提出的方法
- 提出一种高斯随机对偶门机制,以可微且隐私保护的方式概率性地近似特征选择的似然性。
- 采用基于基尼不纯度的特征重要性初始化方法,仅通过服务器与客户端之间的两次参数传输,快速过滤噪声特征。
- 利用部分同态加密(PHE)安全计算特征选择得分,而无需暴露原始数据或标签。
- 应用随机噪声机制,进一步增强特征选择和模型训练过程中的隐私保护。
- 通过随机对偶门减小嵌入向量大小,降低 VFL 系统中的通信成本。
- 将特征选择直接集成到模型训练过程中,实现联合优化和上下文感知的特征选择。

实验结果
研究问题
- RQ1在缺乏对噪声或有用特征数量先验知识的情况下,如何在 VFL 中高效且自适应地执行特征选择?
- RQ2如何在确保数据和标签始终对所有者保密的前提下,在 VFL 中安全地执行特征选择?
- RQ3哪些机制可以降低基于 VFL 的特征选择中的通信和计算开销?
- RQ4如何使特征选择在不同选择特征数量和训练迭代次数下保持稳定且准确?
- RQ5与独立的特征选择和训练流程相比,联合训练与选择框架是否能提升全局模型性能?
主要发现
- 在 RELATHE 数据集上,FedSDG-FS 仅使用 0.44 的 F1 分数阈值,便实现了 99.8% 的测试准确率,优于 SFFS 和原始门方法。
- 在 ARCENE 数据集上,FedSDG-FS 达到了 99.7% 的准确率,F1 分数阈值为 0.59,显著超过 SFFS 和 MS-GINI 基线方法。
- 与基线方法相比,通信成本降低了 50% 以上,ARCENE 和 GISETTE 数据集的通信节省分别达到 53.2% 和 54.7%。
- 模型保持了高度稳定性,第 80 轮训练时测试准确率仅下降 2.8%,而原始门方法则下降了 17.9%。
- 基于基尼不纯度的特征重要性初始化可快速过滤噪声特征,减少训练时间并加速收敛。
- FedSDG-FS 在多个数据集上表现出一致的性能,涵盖表格、图像、文本和音频数据,证实了其鲁棒性和泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。