Skip to main content
QUICK REVIEW

[论文解读] Automated Multi-Label Classification based on ML-Plan

Marcel Wever, Felix Mohr|arXiv (Cornell University)|Nov 9, 2018
Advanced Computational Techniques and Applications被引用 11
一句话总结

本文提出 ML²-Plan,一种用于多标签分类的自动化机器学习(AutoML)框架,通过在 WEKA 的多标签扩展 MEKA 基础上扩展 ML-Plan 框架,实现对多标签分类器的递归优化与通过分层规划选择最优基础学习器。ML²-Plan 在多标签数据集上显著优于随机搜索和单标签 AutoML 基线方法。

ABSTRACT

Automated machine learning (AutoML) has received increasing attention in the recent past. While the main tools for AutoML, such as Auto-WEKA, TPOT, and auto-sklearn, mainly deal with single-label classification and regression, there is very little work on other types of machine learning tasks. In particular, there is almost no work on automating the engineering of machine learning applications for multi-label classification. This paper makes two contributions. First, it discusses the usefulness and feasibility of an AutoML approach for multi-label classification. Second, we show how the scope of ML-Plan, an AutoML-tool for multi-class classification, can be extended towards multi-label classification using MEKA, which is a multi-label extension of the well-known Java library WEKA. The resulting approach recursively refines MEKA's multi-label classifiers, which sometimes nest another multi-label classifier, up to the selection of a single-label base learner provided by WEKA. In our evaluation, we find that the proposed approach yields superb results and performs significantly better than a set of baselines.

研究动机与目标

  • 解决多标签分类(MLC)领域缺乏专用 AutoML 工具的问题,该领域虽日益重要但尚未得到充分探索。
  • 通过采用递归、分层的管道构建方式,克服现有 AutoML 工具将 MLC 视为平面优化问题的局限性。
  • 通过基于规划的方法实现多标签分类器的自动化、实例特定的选择与配置,支持深度嵌套的管道结构。
  • 证明专用 MLC AutoML 框架在可行性与优越性方面优于随机搜索和单标签 AutoML 工具等基线方法。
  • 通过将分层任务网络规划与 MEKA 的多标签学习能力相结合,提供一种可扩展且高效的复杂 MLC 管道配置解决方案。

提出的方法

  • 将基于程序化任务网络规划(HTN 规划的衍生方法)的 AutoML 框架 ML-Plan 适配为支持多标签分类管道的递归、分层配置。
  • 使用 MEKA 作为底层实现层以执行和评估多标签分类器,从而实现与 WEKA 丰富单标签学习器库的集成。
  • 将搜索过程结构化为递归优化:首先选择一个多标签元学习器,若需要则进一步用另一个多标签分类器进行优化,最后为二分类任务选择一个单标签基础学习器。
  • 利用 ML-Plan 已有的优先级排序与搜索策略,引导对复杂 MLC 搜索空间的探索,包括超参数调优与算法选择。
  • 应用贝叶斯优化与类似 SMAC 的技术,在固定超时时间内高效探索分层配置空间。
  • 确保每个管道配置均使用标准 MLC 性能指标(如 F1、汉明损失)在目标数据集上执行并评估。

实验结果

研究问题

  • RQ1基于分层规划的 AutoML 方法能否有效实现多标签分类管道的自动化配置?
  • RQ2ML²-Plan 在多标签分类任务中是否优于已建立的基线方法,如随机搜索和单标签 AutoML 工具(例如 Auto-WEKA)?
  • RQ3与平面优化相比,多标签分类器的递归嵌套结构在多大程度上能从分层规划中获益?
  • RQ4ML²-Plan 配置中所选多标签分类器与基础学习器的多样性如何?是否存在主导性分类器或学习器?
  • RQ5ML²-Plan 的可扩展性限制是什么?未来工作如何通过服务化架构或集成方法加以解决?

主要发现

  • ML²-Plan 显著优于随机搜索以及将多标签问题简化为二元相关性的基线方法(即使用 Auto-WEKA 的方法),证明了专用 MLC AutoML 框架的价值。
  • 该框架成功配置了多样化的多标签分类器,且在所有数据集上均无单一分类器占主导地位,表明实现了有效的实例特定管道选择。
  • 随机森林和朴素贝叶斯多项式等基础学习器被更频繁选择,但这主要归因于它们在 ML-Plan 搜索顺序中的优先级,而非其内在优越性。
  • 部分基础学习器未被选中,归因于探索时间不足——低优先级的学习器在超时前未被评估,凸显了可扩展性限制。
  • ML²-Plan 的递归分层结构能够构建复杂、嵌套的管道,相比平面配置更能适应数据集的特定特征。
  • 结果证实,多标签分类管道通过实例特定的优化可获益,因为没有单一分类器或基础学习器在所有数据集上始终占优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。