[论文解读] Model Reuse with Reduced Kernel Mean Embedding Specification
本文提出使用简化核均值嵌入(RKME)作为预训练机器学习模型的隐私保护型规格,实现无需访问原始训练数据即可复用模型。该两阶段框架——上传RKME规格并基于MMD匹配进行部署——在任务重复和实例重复两种假设下均展现出有效的模型选择能力,在华为的实际工业回归任务中表现优异,同时保护了数据隐私。
Given a publicly available pool of machine learning models constructed for various tasks, when a user plans to build a model for her own machine learning application, is it possible to build upon models in the pool such that the previous efforts on these existing models can be reused rather than starting from scratch? Here, a grand challenge is how to find models that are helpful for the current application, without accessing the raw training data for the models in the pool. In this paper, we present a two-phase framework. In the upload phase, when a model is uploading into the pool, we construct a reduced kernel mean embedding (RKME) as a specification for the model. Then in the deployment phase, the relatedness of the current task and pre-trained models will be measured based on the value of the RKME specification. Theoretical results and extensive experiments validate the effectiveness of our approach.
研究动机与目标
- 为解决在不访问原始训练数据的情况下复用预训练模型的挑战,确保数据隐私。
- 开发一种规格化方法,以有效识别适用于新任务的可复用模型。
- 形式化并验证两种假设(任务重复和实例重复),在此基础上实现模型复用的可行性。
- 在真实世界工业回归项目中证明该方法的实际可行性。
提出的方法
- 在上传阶段,从训练数据分布中构建简化核均值嵌入(RKME),以表示数据分布而不暴露原始样本。
- 在任务重复假设下,使用最大均值差异(MMD)度量当前任务与预训练模型之间的相似性。
- 在实例重复假设下,通过核回溯法生成辅助数据以模拟当前任务的数据分布,并训练选择器以针对每个测试实例识别最佳模型。
- 在部署阶段应用RKME规格,基于分布相似性选择最优预训练模型,而无需访问原始训练数据。
- 采用两阶段流程:上传(规格生成)和部署(模型选择),RKME作为核心规格机制。
- 利用核回溯法在实例重复推理过程中高效且具有代表性地生成辅助数据。
实验结果
研究问题
- RQ1能否构建一种模型规格,使其在不暴露原始训练数据的情况下实现模型复用?
- RQ2当仅能访问模型规格而无法访问模型本身时,如何度量新任务与预训练模型之间的相似性?
- RQ3在何种分布假设下(例如任务重复或实例重复)可实现有效的模型复用?
- RQ4RKME规格化方法在准确性和隐私保护方面是否优于现有模型复用与迁移学习方法?
主要发现
- 所提出的基于RKME的框架在华为的实际回归任务中达到最先进性能,RMSE为0.0279,优于模型复用基线RAND和AVG。
- 本方法在3f1指标上取得52.05%的F1分数,在3p30指标上达到80.82%,在部分指标上超越非私有的迁移学习方法(如mSDA和KMM),同时保护了数据隐私。
- 通过核回溯法生成的辅助数据实现的实例重复流程,即使当前任务是先前解决任务的混合,也能实现精确的模型选择。
- 该框架通过确保在RKME规格构建后不暴露任何原始训练数据,维持了数据隐私,满足不可访问性要求。
- 实验表明,随着混合任务数量的减少,该方法可通过选择合适的预训练模型排除不可能的输出类别,从而提升鲁棒性。
- RKME规格在任务重复和实例重复两种假设下均能实现有效的模型复用,具备理论与实证支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。