Skip to main content
QUICK REVIEW

[论文解读] A Nested Genetic Algorithm for Explaining Classification Data Sets with Decision Rules

Paul-Amaury Matt, Rosina Ziegler|arXiv (Cornell University)|Aug 23, 2022
Rough Sets and Fuzzy Logic被引用 4
一句话总结

本文提出一种嵌套遗传算法,称为二次遗传算法(QGA),以从分类数据集中自动提取简洁、准确且高覆盖率的决策规则集。通过结合启发式初始化(RF+HC)与两个内部遗传算法以增强解的可行性与适应度,QGA 在 10 个公开数据集上表现优于基线方法,实现最高 98.6% 的覆盖率,同时保持极低的规则复杂度与错误数。

ABSTRACT

Our goal in this paper is to automatically extract a set of decision rules (rule set) that best explains a classification data set. First, a large set of decision rules is extracted from a set of decision trees trained on the data set. The rule set should be concise, accurate, have a maximum coverage and minimum number of inconsistencies. This problem can be formalized as a modified version of the weighted budgeted maximum coverage problem, known to be NP-hard. To solve the combinatorial optimization problem efficiently, we introduce a nested genetic algorithm which we then use to derive explanations for ten public data sets.

研究动机与目标

  • 自动提取一组紧凑、准确且高覆盖率的决策规则,以解释分类数据集。
  • 通过将选择最优规则集的问题形式化为改进的加权预算最大覆盖问题,解决其 NP-难性质。
  • 通过生成本质上可解释的(白盒)基于规则的模型,克服事后可解释性方法的局限性。
  • 通过整合启发式初始化与多级遗传优化,改进现有规则提取技术,实现更高的覆盖率与可行性。

提出的方法

  • 该方法从在数据上训练的决策树中提取规则,形成初始候选规则池。
  • 采用启发式方法(RF+HC)生成初始规则集种群,以实现高覆盖率与低复杂度。
  • 采用嵌套遗传算法架构,其中两个内部遗传算法分别用于采样满足不等式约束(Ax ≤ b)的可行解,以及生成有益的变异。
  • 通过二次无约束二值优化(QUBO)公式化适应度函数,平衡覆盖率、准确性、规则数量与不一致性。
  • 内部遗传算法迭代优化解,提升覆盖率,同时保持可行性并减少计算时间。
  • 基于 30 次运行中的最高适应度得分选择最终规则集,确保鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1嵌套遗传算法能否有效解决分类数据集最优规则集选择的 NP-难问题?
  • RQ2与标准进化方法相比,内部遗传算法的集成在提升解的可行性与覆盖率方面有何改进?
  • RQ3与基线规则提取技术相比,该方法在实现更高覆盖率的同时,能否显著降低规则复杂度与错误数?
  • RQ4结合启发式初始化种群与多级遗传优化,是否能实现更可扩展且更鲁棒的规则集生成?

主要发现

  • 在 Tic-tac-toe 数据集中,QGA 实现了最高 98.6% 的覆盖率,显著优于 RF+HC(96.3%)与 IRFRE(14.4%)的覆盖率。
  • 在 Blood Transfusion 数据集中,QGA 达到 99.1% 的准确率,覆盖率 96.9/100,错误数仅 149.4/150,优于 RF+HC(97.9% 准确率,96.4/100 覆盖率)。
  • 与 IRFRE 及 IRFRE RF+HC 相比,QGA 缩短了计算时间,在大多数数据集中于 120 秒内实现高覆盖率。
  • 嵌套遗传算法成功克服了标准遗传算法中不可行解的问题,实现了各代之间持续的适应度提升。
  • 在 Mammographic Mass 数据集中,QGA 实现 97.3% 准确率,覆盖率 84.6/90,错误数 148.7/150,优于 IRFRE(81.9% 准确率,46.6/90 覆盖率)。
  • 适应度演化曲线显示,所有数据集中最小、平均与最大适应度得分均随代数持续提升,并收敛至 100%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。