[论文解读] Towards Label Imbalance in Multi-label Classification with Many Labels
该论文提出RMLS,一种基于表示的多标签学习新方法,结合采样策略以解决具有大量标签的多标签分类中的标签不平衡问题。通过在训练过程中有策略地采样相关和无关标签,RMLS降低了频繁标签的主导性,提升了在标签不平衡数据集上的性能,在包含最多50,000个标签的真实世界基准测试中,F1得分和汉明损失均优于现有方法。
In multi-label classification, an instance may be associated with a set of labels simultaneously. Recently, the research on multi-label classification has largely shifted its focus to the other end of the spectrum where the number of labels is assumed to be extremely large. The existing works focus on how to design scalable algorithms that offer fast training procedures and have a small memory footprint. However they ignore and even compound another challenge - the label imbalance problem. To address this drawback, we propose a novel Representation-based Multi-label Learning with Sampling (RMLS) approach. To the best of our knowledge, we are the first to tackle the imbalance problem in multi-label classification with many labels. Our experimentations with real-world datasets demonstrate the effectiveness of the proposed approach.
研究动机与目标
- 解决在具有大量标签的多标签分类中被忽视的标签不平衡问题,其中稀有标签代表性不足。
- 克服现有可扩展方法(如LSDR和RBL)中标签不平衡的累积效应,这些方法通常会丢弃或低估频率较低的标签。
- 开发一种可扩展且高效的方法,即使标签数量达到数万个,也能保持高性能。
- 引入一种采样策略,在模型训练过程中平衡相关与无关标签的表示。
- 在具有极端标签基数和不平衡性的现实世界数据集上,验证所提方法的有效性。
提出的方法
- 提出一种基于表示的学习框架,将实例和标签联合嵌入到共享嵌入空间中。
- 引入一种采样策略,通过超参数α控制训练过程中正样本(相关)与负样本(无关)标签的比例。
- 使用对比损失函数优化模型,鼓励正样本实例-标签对之间的接近性,以及负样本对之间的分离性。
- 使用小批量训练,其中每个小批量根据采样系数α包含相关与无关标签的平衡组合。
- 通过计算实例嵌入与标签嵌入之间的相似度得分,将训练好的模型用于标签预测。
- 通过选择相似度得分最高的top-k个标签来解码预测结果,确保在大规模标签集合下仍具可扩展性。
实验结果
研究问题
- RQ1当标签数量极大时,标签不平衡如何影响现有多标签学习方法的性能?
- RQ2采样策略是否能有效缓解在具有大量标签的多标签分类中标签不平衡的负面影响?
- RQ3所提出的RMLS方法是否在标签不平衡、大规模的多标签数据集上优于当前最先进的RBL和LSDR方法?
- RQ4在稀有标签欠拟合与主导标签过拟合之间取得平衡的最优采样比例α是多少?
- RQ5在包含最多50,000个标签的数据集上,该方法在训练时间和内存使用方面的可扩展性如何?
主要发现
- RMLS在所有四个基准数据集上均取得最高的F1得分,包括$\text{Enron}$、$\text{Delicious}$、$\text{Eurlex}\_\text{desc}$和$\text{Wiki}$,相较于次优方法最高提升0.05。
- 在具有3,993个标签的$\text{Eurlex}\_\text{desc}$数据集上,RMLS在$k=50$时取得$0.338 \pm 0.008$的F1得分,显著优于PLST($0.321 \pm 0.007$)和ML_CSSP($0.338 \pm 0.008$)。
- RMLS的汉明损失始终低于其他方法,在$k=50$时于$\text{Eurlex}\_\text{desc}}$上达到$0.096 \pm 0.007$,表明其预测精度更高。
- RMLS的训练时间显著短于LEML和WSABIE,尤其在包含50,000个标签的$\text{Wiki}$数据集上,RMLS耗时$15,173.62 \pm 74.74$秒,而LEML耗时$57,849.32 \pm 523.17$秒。
- 最优采样比例α约为5–7,此时F1得分和准确率达到峰值,随后因过度采样无关标签而下降。
- RMLS有效缓解了标签不平衡问题,表现为在稀有标签上的性能提升,即使在$\text{Eurlex}\_\text{desc}$数据集上平均不平衡比达到1,378.58时亦如此。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。