[论文解读] Deep Extreme Multi-label Learning
本文提出深度极多标签学习(DXML),一种深度神经网络框架,通过显式标签图建模标签共现关系,联合学习非线性特征空间与标签空间嵌入。通过将基于图的标签先验与深度学习相结合,DXML在极多标签基准数据集上取得最先进性能,在小规模数据集上相比SLEEC的P@k和nDCG@k提升最高达4%,在Amazon-670K数据集上提升达28%。
Extreme multi-label learning (XML) or classification has been a practical and important problem since the boom of big data. The main challenge lies in the exponential label space which involves $2^L$ possible label sets especially when the label dimension $L$ is huge, e.g., in millions for Wikipedia labels. This paper is motivated to better explore the label space by originally establishing an explicit label graph. In the meanwhile, deep learning has been widely studied and used in various classification problems including multi-label classification, however it has not been properly introduced to XML, where the label space can be as large as in millions. In this paper, we propose a practical deep embedding method for extreme multi-label classification, which harvests the ideas of non-linear embedding and graph priors-based label space modeling simultaneously. Extensive experiments on public datasets for XML show that our method performs competitive against state-of-the-art result.
研究动机与目标
- 解决大规模标签空间(如数百万标签)下的极多标签学习(XML)挑战,传统方法因计算不可行而失效。
- 克服现有基于嵌入的XML方法的局限性,这些方法依赖低秩假设且忽略标签结构(如共现模式)。
- 将非线性深度学习与显式标签图建模相结合,以更好地捕捉高维标签空间中的复杂标签依赖关系。
- 开发一种可扩展的端到端深度学习框架,支持高效训练与新数据的增量学习。
- 在保持与SLEEC、FastXML等最先进方法相当的推理时间的同时,提升预测准确率。
提出的方法
- 从训练数据构建显式标签图,若任意训练样本中两个标签共现,则在它们之间建立边,以编码标签共现结构。
- 设计一个包含两层全连接层(W1和W2)及ReLU激活函数的深度神经网络,学习从输入特征到低维标签嵌入的非线性映射。
- 在最终嵌入层后应用ℓ₂归一化,以提升泛化能力并确保嵌入幅度一致。
- 采用基于k-NN的标签预测策略:对测试样本,根据其在学习到的嵌入空间中最近邻的k个标签进行预测。
- 使用带动量、权重衰减和Dropout正则化的随机梯度下降(SGD)进行网络训练。
- 通过在验证集上进行交叉验证,调优超参数k以优化预测性能。
实验结果
研究问题
- RQ1显式标签图建模能否提升基于深度学习的极多标签分类性能?
- RQ2非线性深度嵌入相较于线性或低秩嵌入,在捕捉XML中复杂标签依赖关系方面表现如何?
- RQ3结合标签图先验的深度学习框架能否在保持计算高效的同时实现最先进准确率?
- RQ4所提方法是否支持增量学习,而现有基于嵌入的方法(如SLEEC)不支持?
- RQ5该模型在不同规模和标签维度的数据集上如何扩展?
主要发现
- 在Delicious数据集上,DXML相比SLEEC在P@k和nDCG@k上提升约1%;在Bibtex和MediaMill数据集上,{P, nDCG}@{3,5}提升接近4%。
- 在大型Amazon-670K数据集上,DXML相比LFML在P@k和nDCG@k上提升28%,相比LPSR-NB提升9%。
- DXML在推理时间上与SLEEC相当,表明深度学习方法未带来不可接受的推理成本。
- 消融实验表明,嵌入网络中使用ReLU非线性激活相比线性嵌入显著提升性能,该结果在Delicious-200K上得到验证。
- DXML支持增量学习,而SLEEC在新数据到达时需从头重新训练。
- 该模型在小规模数据集(如Bibtex、MediaMill)和大规模数据集(如Amazon-670K)上均表现出良好泛化能力,显示其鲁棒性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。