[论文解读] Infinite Recommendation Networks: A Data-Centric Approach
本文提出 ∞-AE,一种基于神经正切核的无限宽自编码器的、数据中心化的推荐模型,实现闭式、高度表达的协同过滤。此外,提出了 Distill-CF,一种可微分的数据蒸馏框架,利用 ∞-AE 生成紧凑、高保真的数据摘要,仅使用 0.1% 的数据即可达到全数据集 96–105% 的性能,表明在推荐系统中,数据质量可超越数据量。
We leverage the Neural Tangent Kernel and its equivalence to training infinitely-wide neural networks to devise $\infty$-AE: an autoencoder with infinitely-wide bottleneck layers. The outcome is a highly expressive yet simplistic recommendation model with a single hyper-parameter and a closed-form solution. Leveraging $\infty$-AE's simplicity, we also develop Distill-CF for synthesizing tiny, high-fidelity data summaries which distill the most important knowledge from the extremely large and sparse user-item interaction matrix for efficient and accurate subsequent data-usage like model training, inference, architecture search, etc. This takes a data-centric approach to recommendation, where we aim to improve the quality of logged user-feedback data for subsequent modeling, independent of the learning algorithm. We particularly utilize the concept of differentiable Gumbel-sampling to handle the inherent data heterogeneity, sparsity, and semi-structuredness, while being scalable to datasets with hundreds of millions of user-item interactions. Both of our proposed approaches significantly outperform their respective state-of-the-art and when used together, we observe 96-105% of $\infty$-AE's performance on the full dataset with as little as 0.1% of the original dataset size, leading us to explore the counter-intuitive question: Is more data what you need for better recommendation?
研究动机与目标
- 解决在推荐系统中,对大规模、稀疏用户-物品交互数据集进行训练所带来的日益增长的计算与环境成本。
- 通过系统性地进行数据摘要,提升数据质量,而非单纯增加数据规模,以改善模型性能。
- 开发一种可扩展的、可微分的方法,从大规模、异构且稀疏的推荐数据中提炼出信息丰富、通用的数据摘要。
- 探究高质量、极小规模的数据摘要是否能超越全量数据集,尤其是在存在噪声或计算资源受限的情况下。
- 证明数据中心化改进可超越传统模型架构进步,在推荐性能上实现更优表现。
提出的方法
- 利用神经正切核(NTK)训练无限宽自编码器(∞-AE),采用闭式解法,实现快速、高表达且无需参数调整的协同过滤。
- 将 ∞-AE 作为组件嵌入双层优化框架 Distill-CF 中,其中外层循环通过可微分 Gumbel 采样优化数据摘要的选择。
- 采用多步可微分 Gumbel 采样,以处理数据稀疏性、异构性与半结构化特征,同时保持对拥有 1 亿+交互记录的数据集的可扩展性。
- 采用双层目标函数:内层循环在当前数据摘要上训练 ∞-AE,外层循环通过基于梯度的选择更新摘要。
- 通过实证表明,基于蒸馏摘要训练的模型通常优于在全量噪声数据上训练的模型,体现出显著的去噪效果。
- 通过将蒸馏摘要重用于训练多种下游模型(如 EASE、MVAE)而无需重新训练蒸馏过程,验证了蒸馏摘要的通用性。
实验结果
研究问题
- RQ1具有闭式解的无限宽自编码器是否能超越当前最先进的有限宽推荐模型?
- RQ2通过可微分 Gumbel 采样进行数据蒸馏,是否能生成既紧凑又对下游模型训练高度信息丰富的摘要?
- RQ3在仅使用 0.1% 数据的蒸馏摘要上训练的模型,其性能是否可与在全量数据集上训练的模型相媲美?
- RQ4数据蒸馏是否具有内在的去噪能力,使得在蒸馏数据上训练的模型优于在全量噪声数据上训练的模型?
- RQ5蒸馏数据摘要是否可被通用复用于多种不同的下游模型,而无需重新训练蒸馏流程?
主要发现
- ∞-AE 仅使用单个全连接层和单个超参数,就在四个基准数据集上实现了最先进性能,且具备闭式解。
- Distill-CF 生成的数据摘要比原始数据集小 2–3 个数量级,同时保留了 ∞-AE 在全量数据集上 96–105% 的性能。
- 当原始数据包含噪声时,在蒸馏摘要上训练的模型性能优于在全量数据上训练的模型,体现出显著的去噪效果。
- 蒸馏摘要具有普遍有效性:即使在蒸馏过程未涉及的模型(如 EASE 和 MVAE)上使用,其性能也与在全量数据上训练相当。
- ∞-AE 与 Distill-CF 的结合实现了高保真、低成本的推荐流水线,且 Distill-CF 可扩展至包含数亿次交互的数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。