[论文解读] A Skew-Sensitive Evaluation Framework for Imbalanced Data Classification
本文提出一种对偏态敏感的评估框架——加权平衡准确率(WBA),该框架同时考虑了类别基数偏态和任意类别重要性,在类别不平衡的多分类任务中具有优势。通过引入基于稀有性或用户自定义重要性的可配置类别权重,该方法实现了更公平的分类器评估,并提升了模型训练效果,在日志解析、情感分析和URL分类等实际任务中,优于传统的准确率(Accuracy)和平衡准确率(Balanced Accuracy)等指标。
Class distribution skews in imbalanced datasets may lead to models with prediction bias towards majority classes, making fair assessment of classifiers a challenging task. Metrics such as Balanced Accuracy are commonly used to evaluate a classifier's prediction performance under such scenarios. However, these metrics fall short when classes vary in importance. In this paper, we propose a simple and general-purpose evaluation framework for imbalanced data classification that is sensitive to arbitrary skews in class cardinalities and importances. Experiments with several state-of-the-art classifiers tested on real-world datasets from three different domains show the effectiveness of our framework - not only in evaluating and ranking classifiers, but also training them.
研究动机与目标
- 解决现有评估指标在类别重要性与类别频率不一致时,对类别不平衡多分类器评估能力有限的问题。
- 设计一种通用评估框架,兼具简洁性与可扩展性,适用于多样化应用领域。
- 通过在性能指标中引入非均匀类别重要性,实现分类器的公平比较评估。
- 展示该框架在评估与主动提升模型训练方面的实用性,通过加权损失函数实现。
提出的方法
- 提出加权平衡准确率(WBA)作为标量指标,通过引入可配置类别权重,将平衡准确率推广至更一般情形。
- 采用基于稀有性(WBA_rarity)或用户定义重要性(WBA_user)的类别权重,以反映各类别的不同重要性。
- 在评估与训练阶段均应用WBA指标,通过对应类别权重调整损失函数。
- 在三个真实世界领域(系统日志解析、情感分析、URL分类)验证该框架的有效性。
- 在URL分类实验中,将分类器输出映射至统一类别空间,以支持跨厂商比较。
- 采用模块化设计,可扩展至任意数量类别及任意重要性标准。
实验结果
研究问题
- RQ1如何使分类器评估对多分类不平衡数据中的类别基数偏态和非均匀类别重要性均保持敏感?
- RQ2在类别偏态不匹配的情况下,通用评估指标能否优于传统指标(如Accuracy和Balanced Accuracy)在分类器排序上的表现?
- RQ3当类别权重与重要性标准对齐时,WBA在多大程度上可提升模型训练效果?
- RQ4WBA在真实应用场景(如日志解析、情感分析和URL分类)中的表现如何?
主要发现
- 使用基于稀有性的权重进行训练时,WBA_rarity从0.653提升至0.761,显著改善了对稀有但重要类别的学习效果。
- 当用户自定义权重优先考虑恶意软件类别时,WBA_user从0.640提升至0.752,有效增强了高影响预测的性能。
- 未使用类别权重的原始训练方式虽在良性类别上取得高准确率(0.99),但在稀有类别上表现极差(如NSFW类仅0.0),凸显了加权训练的必要性。
- 在WBA_rarity指标下,分类器A表现最佳,而D的总体准确率最高但重要性敏感指标排名较低,揭示了传统指标可能导致的误排序问题。
- 在URL分类任务中,D的准确率最高,但在WBA_rarity下B或A更优,表明标准指标无法反映真实世界中的重要性。
- 该框架支持训练过程中的有效重加权,基于WBA的损失函数显著提升了对代表性不足但影响重大的类别的预测准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。