[论文解读] RaFM: Rank-Aware Factorization Machines
RaFM 提出了一种感知秩的因子分解机,为每个特征分配特定的嵌入秩以建模成对交互,从而在稀疏且频率多变的数据集上提升性能。通过动态管理活跃因子,RaFM 在降低计算和存储成本的同时,实现了优于标准 FMs 的准确率,使训练和推理效率可与固定秩 FMs 比肩或更优。
Factorization machines (FM) are a popular model class to learn pairwise interactions by a low-rank approximation. Different from existing FM-based approaches which use a fixed rank for all features, this paper proposes a Rank-Aware FM (RaFM) model which adopts pairwise interactions from embeddings with different ranks. The proposed model achieves a better performance on real-world datasets where different features have significantly varying frequencies of occurrences. Moreover, we prove that the RaFM model can be stored, evaluated, and trained as efficiently as one single FM, and under some reasonable conditions it can be even significantly more efficient than FM. RaFM improves the performance of FMs in both regression tasks and classification tasks while incurring less computational burden, therefore also has attractive potential in industrial applications.
研究动机与目标
- 解决标准因子分解机(FMs)在特征出现频率高度可变时性能下降的问题。
- 通过允许特征特定的嵌入秩,减少对罕见特征的过拟合和对频繁特征的欠拟合。
- 尽管每个特征使用多个秩,仍保持计算和存储效率。
- 开发一种高效处理非活跃因子并确保收敛的训练算法。
- 在公开数据集和工业规模数据集上展示优越的性能与效率。
提出的方法
- RaFM 为每个特征分配多个具有不同秩的嵌入向量,其中最大秩由特征频率决定。
- 使用秩特定点积的求和来建模成对交互:$\left<\mathcal{V}_i, \mathcal{V}_j\right> = \sum_{k=1}^{k_i} \bm{v}_i^{(k)} \cdot \bm{v}_j^{(k)}$。
- 模型利用了大量高阶分量在特征为零时处于非活跃状态(值为零)的特性,从而实现高效存储与计算。
- 提出一种统一的训练算法,避免存储和更新非活跃因子,降低计算开销。
- 理论分析在合理假设下证明了有界的训练误差和收敛速率。
- 通过使用 FTRL 实现稀疏性,结合分布式学习以提升工业场景下的可扩展性。
实验结果
研究问题
- RQ1通过为每个特征分配不同的嵌入秩,因子分解机模型是否能在特征频率高度偏斜的数据集上实现更好的性能?
- RQ2此类模型与具有固定秩的标准 FMs 相比,是否能保持或提升效率?
- RQ3在多秩嵌入中动态管理活跃与非活跃因子,是否能减少模型大小并加快训练速度?
- RQ4所提出的训练算法是否能在避免因参数过多导致过拟合的前提下实现高效收敛?
- RQ5在真实世界和工业数据集上,RaFM 与 DiFacto 和 MRMA 等现有方法相比,在性能和计算成本方面表现如何?
主要发现
- 在 ML 10M、ML 20M 和 AMovie 数据集上,RaFM 将对数损失降低 1% 至 2%,在 Frappe 数据集上降低 15%,且统计显著。
- 在 Criteo 数据集上,RaFM 将对数损失降低 0.002,超过 0.001 的实际显著性阈值。
- 在公开数据集上,RaFM 将模型大小减少至标准 FM 的 20%–66%,训练时间减少至 FM 的 24%–95%。
- 在包含 17 亿条记录和 1.2 亿特征的工业点击率数据集上,RaFM 相较逻辑回归将 AUC 提升约 1%,且模型大小仅为 FM 的 1.55 倍,而 FM 为 7 倍。
- 与 FM 相比,RaFM 实现了 22% 的模型大小缩减,同时保持或超越其 AUC 表现,展示了更优的效率-准确率权衡。
- 训练算法确保了有界的误差和收敛性,非活跃因子被排除在计算和参数更新之外,从而实现高效学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。