[论文解读] Towards Open-World Feature Extrapolation: An Inductive Graph Learning Approach
本文提出FATE,一种新颖的归纳图学习框架,用于开放世界特征外推,使模型能够在不重新训练的情况下泛化到未见过的特征。通过将主干神经网络与基于特征-数据二分图的图神经网络相结合,该方法利用消息传递机制学习新特征的嵌入表示,在表格数据和大规模广告数据集上实现了最先进性能,同时提升了泛化能力并减少了过拟合。
We target open-world feature extrapolation problem where the feature space of input data goes through expansion and a model trained on partially observed features needs to handle new features in test data without further retraining. The problem is of much significance for dealing with features incrementally collected from different fields. To this end, we propose a new learning paradigm with graph representation and learning. Our framework contains two modules: 1) a backbone network (e.g., feedforward neural nets) as a lower model takes features as input and outputs predicted labels; 2) a graph neural network as an upper model learns to extrapolate embeddings for new features via message passing over a feature-data graph built from observed data. Based on our framework, we design two training strategies, a self-supervised approach and an inductive learning approach, to endow the model with extrapolation ability and alleviate feature-level over-fitting. We also provide theoretical analysis on the generalization error on test data with new features, which dissects the impact of training features and algorithms on generalization performance. Our experiments over several classification datasets and large-scale advertisement click prediction datasets demonstrate that our model can produce effective embeddings for unseen features and significantly outperforms baseline methods that adopt KNN and local aggregation.
研究动机与目标
- 解决开放世界特征外推的挑战,即模型必须处理训练期间未见过的新特征。
- 克服标准神经网络在引入新特征时需要重新训练的局限性。
- 开发一种可扩展的归纳学习框架,通过基于图的消息传递机制泛化到未见过的特征。
- 通过新颖的采样与正则化策略,减少大规模数据集中的特征级别过拟合。
- 对存在新特征情况下的泛化误差提供理论分析,将模型性能与采样随机性联系起来。
提出的方法
- 该框架采用双模块设计:主干前馈网络用于初始特征嵌入,图神经网络(GNN)用于归纳式特征外推。
- 从观测到的训练数据构建特征-数据二分图,其中节点表示特征和数据实例,边编码特征与实例之间的关系。
- GNN在二分图上执行消息传递,基于已知的特征和实例表示,为新出现的、未见过的特征生成嵌入表示。
- 提出两种训练策略:自监督学习,以及使用k-shot采样或n折划分生成多样化代理训练数据的归纳学习。
- 在图上应用DropEdge正则化,通过在训练过程中随机丢弃边来防止过拟合。
- 通过小批量优化端到端训练模型,实现对包含数百万个特征和实例的数据集的可扩展性。
实验结果
研究问题
- RQ1机器学习模型是否能在不重新训练的情况下泛化到新的、未见过的特征,从而模拟人类的外推能力?
- RQ2如何利用图神经网络基于现有特征和实例关系,归纳学习新特征的嵌入表示?
- RQ3在大规模开放世界设置中,何种训练策略(如k-shot采样与n折划分)能最好地平衡泛化能力与鲁棒性?
- RQ4采样随机性如何影响模型泛化能力,能否对其进行理论量化?
- RQ5DropEdge正则化在开放世界特征外推中在多大程度上缓解了特征级别的过拟合?
主要发现
- FATE在特征外推任务中显著优于KNN和局部聚合基线模型,在UCI以及大规模Criteo/Avazu数据集上均取得了更高的AUC值。
- 在Avazu和Criteo数据集上,k-shot采样始终优于n-fold划分,提升了泛化能力并减少了过拟合。
- 随着采样规模$k$增大,训练AUC因方差减小而提升,但当$k$接近完整特征集时性能趋于平稳甚至下降,表明存在特征级别的过拟合。
- 消融实验表明,采用k-shot采样与DropEdge的FATE表现最佳,在Criteo测试折T8上AUC达到0.7744,优于端到端联合训练。
- 理论分析证实,泛化误差依赖于特征采样随机性,较大的$k$会降低这种随机性,从而损害泛化性能——与实证结果一致。
- 该框架具有高效可扩展性:训练和推理时间随小批量大小和特征数量呈次线性增长,且在大规模数据集上GPU显存使用保持可控。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。