[论文解读] Aggressive Sampling for Multi-class to Binary Reduction with Applications to Text Classification
该论文提出一种双重采样策略,将大规模多分类文本分类问题简化为二分类问题,从而在长尾类别分布下提升效率与一致性。通过过采样小类别和欠采样大类别,并构建一组精简的成对样本,该方法在包含最多10万种类别的数据集上实现了SOTA性能,同时显著降低内存占用与训练时间。
We address the problem of multi-class classification in the case where the number of classes is very large. We propose a double sampling strategy on top of a multi-class to binary reduction strategy, which transforms the original multi-class problem into a binary classification problem over pairs of examples. The aim of the sampling strategy is to overcome the curse of long-tailed class distributions exhibited in majority of large-scale multi-class classification problems and to reduce the number of pairs of examples in the expanded data. We show that this strategy does not alter the consistency of the empirical risk minimization principle defined over the double sample reduction. Experiments are carried out on DMOZ and Wikipedia collections with 10,000 to 100,000 classes where we show the efficiency of the proposed approach in terms of training and prediction time, memory consumption, and predictive performance with respect to state-of-the-art approaches.
研究动机与目标
- 解决如Wikipedia和DMOZ等数据集中类别数量极多的极端多分类文本分类挑战。
- 克服真实世界文本数据集中常见的长尾类别分布问题。
- 在不牺牲泛化性能的前提下,降低多分类转二分类过程中成对样本构建的计算成本。
- 确保在采样引起的分布偏移与成对样本相互依赖性下,经验风险最小化的稳定性。
- 在极端多分类设置中,实现预测性能、训练时间与内存消耗之间的理想权衡。
提出的方法
- 采用双重采样策略:首先在原始训练集中对小类别进行过采样,对大类别进行欠采样,以平衡类别分布。
- 通过将每个样本与其真实类别配对,并与重采样后的类别集合中随机采样的负类别配对,构建一组精简的成对样本。
- 使用在精简成对数据集上训练的二分类器,预测给定的(样本,类别)对是否为正样本(真实标签)或负样本(错误标签)。
- 引入基于局部分数阶Radečař复杂度的理论框架,证明在变换后的采样分布下经验风险最小化的收敛性。
- 利用基于相似度的特征表示,同时对样本和类别进行建模,以提升二分类简化空间中的泛化能力。
- 在泛化界中正式考虑共享相同样本和真实类别的成对样本之间的相互依赖性。
实验结果
研究问题
- RQ1在极端多分类设置下,对训练样本和负类别进行激进采样,是否能提升多分类转二分类的效率?
- RQ2所提出的采样策略是否能在分布偏移与成对样本相互依赖性下,仍保持经验风险最小化的稳定性?
- RQ3在大规模文本分类基准上,该方法在训练时间、内存使用和预测性能方面与SOTA方法相比如何?
- RQ4该方法在多大程度上缓解了真实世界文本数据集中长尾类别分布的负面影响?
- RQ5该方法在5万至10万个类别的数据集上是否能有效扩展,同时保持高准确率与低资源消耗?
主要发现
- 在包含10万个类别的Wikipedia-100K数据集上,所提出的$(\boldsymbol{\nu},\boldsymbol{\rho})$-DS方法达到了25%的准确率和17.8%的宏F1,优于OVA、M-SVM和FastXML。
- 在Wikipedia-100K上,该方法将训练时间减少至9,264秒,内存使用降至9.8 GB,而OVA和M-SVM的内存消耗超过1000 GB。
- 在Wikipedia-50K上,该方法实现了33.8%的准确率和23.4%的宏F1,预测时间仅为37.23秒,显著优于基于树的方法。
- $(\boldsymbol{\nu},\boldsymbol{\rho})$-DS方法在运行时间、内存消耗与性能之间实现了最佳整体权衡,即使在内存使用较高的PD-Sparse方法面前也表现更优。
- 基于树的方法如FastXML和RecallTree因级联错误导致性能下降,尽管推理速度较快,但准确率较低(如在DMOZ上仅为15.6%)。
- 该方法在激进采样下仍保持高度一致性和泛化性能,其理论边界通过局部分数阶Radečař复杂度得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。