Skip to main content
QUICK REVIEW

[论文解读] Multi-label classification search space in the MEKA software

Alex G. C. de Sá, Alex A. Freitas|arXiv (Cornell University)|Nov 28, 2018
Text and Document Classification Technologies参考文献 60被引用 4
一句话总结

本文提出了一种形式化的上下文无关语法,用于建模 MEKA 和 WEKA 框架中多标签分类(MLC)算法的搜索空间,从而实现对自动化 MLC 方法的系统性实验评估。该方法整合了 26 种 MLC 算法、28 种单标签分类器以及 10 种元算法,明确包含约束、依赖关系和超参数配置,为自动化机器学习流水线提供了一个全面且可执行的搜索空间。

ABSTRACT

This supplementary material aims to describe the proposed multi-label classification (MLC) search spaces based on the MEKA and WEKA softwares. First, we overview 26 MLC algorithms and meta-algorithms in MEKA, presenting their main characteristics, such as hyper-parameters, dependencies and constraints. Second, we review 28 single-label classification (SLC) algorithms, preprocessing algorithms and meta-algorithms in the WEKA software. These SLC algorithms were also studied because they are part of the proposed MLC search spaces. Fundamentally, this occurs due to the problem transformation nature of several MLC algorithms used in this work. These algorithms transform an MLC problem into one or several SLC problems in the first place and solve them with SLC model(s) in a next step. Therefore, understanding their main characteristics is crucial to this work. Finally, we present a formal description of the search spaces by proposing a context-free grammar that encompasses the 54 learning algorithms. This grammar basically comprehends the possible combinations, the constraints and dependencies among the learning algorithms.

研究动机与目标

  • 为使用 MEKA 和 WEKA 的自动化多标签分类(MLC)方法定义一个全面且可执行的搜索空间。
  • 对 26 种 MLC 算法和 28 种单标签分类器之间的依赖关系、约束条件以及超参数配置进行建模。
  • 通过形式化问题转换、算法适配与元算法之间的相互作用,实现对 MLC 流水线的系统性实验评估。
  • 通过提供一种结构化、基于语法的可行 MLC 配置表示,支持自动化机器学习(AutoML)工作流。

提出的方法

  • 提出一种上下文无关语法,形式化描述 MEKA 和 WEKA 中使用的 54 种学习算法(26 种 MLC、28 种 SLC、10 种元算法)。
  • 为问题转换(PT)方法定义生成规则,包括针对受约束算法(如贝叶斯分类器链 BCC 和 MCC 族群 PMCC)的专用规则。
  • 为算法适配(AA)方法引入独立的语法规则,以 ML-BPNN 为例,其超参数包括:训练轮数、隐藏单元数、初始学习率和动量。
  • 通过分层规则(<META-MLC1>、<META-MLC2>、<META-MLC3>)建模元算法的集成,强制规定哪些 MLC 算法可与哪些元算法组合。
  • 使用随机生成函数(如 RANDOM-INT、RANDOM-REAL)编码超参数范围,以反映真实的搜索空间边界。
  • 通过编码已知的 MEKA 软件约束(如 BCC 仅可与四种特定元算法组合)确保配置的有效性,防止无效配置。

实验结果

研究问题

  • RQ1如何形式化描述 MEKA 和 WEKA 中多标签分类算法的搜索空间,以支持自动化实验评估?
  • RQ2MLC 算法及其与元算法集成过程中,关键的依赖关系、约束条件和超参数配置是什么?
  • RQ3在 MEKA 框架中,哪些问题转换、算法适配与元算法方法的组合是有效且可执行的?
  • RQ4如何利用上下文无关语法来建模 MLC 算法、单标签分类器与元算法之间复杂的相互作用,以真实反映软件行为?
  • RQ5阈值校准(如 PCut1、PCutL)在提升 MLC 性能中的作用是什么,以及它如何被集成到搜索空间中?

主要发现

  • 所提出的语法成功建模了 54 种学习算法(26 种 MLC、28 种 SLC、10 种元算法),并明确包含约束条件和超参数范围。
  • 问题转换方法(PT)占 MLC 算法的 84.21%(19 个中的 16 个),并为不同约束级别(如 BCC 和 PMCC)设置了独立的语法规则。
  • 唯一建模的算法适配(AA)方法是 ML-BPNN,其超参数包括:训练轮数(10–1000)、隐藏单元数(0.2–1.0 × 特征数)、学习率(0.001–0.1)和动量(0.2–0.8)。
  • BaggingML 和 EnsembleML 等元算法有特定的参数范围:袋大小百分比(10–50)和特征百分比(10–100),其中 EnsembleML 的袋大小使用独立范围(52–72)。
  • 语法强制实施了软件层面的约束,如 BCC 仅可与四种元算法(SM、RSML、EM、CM)组合,从而防止无效配置。
  • 通过 PCut1 和 PCutL 实现的阈值校准被正式集成,其中 PCut1 作为默认设置,通过使预测标签基数与训练数据对齐,提升了预测可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。