Skip to main content
QUICK REVIEW

[論文レビュー] Multi-label classification search space in the MEKA software

Alex G. C. de Sá, Alex A. Freitas|arXiv (Cornell University)|Nov 28, 2018
Text and Document Classification Technologies参考文献 60被引用数 4
ひとこと要約

本稿は、MEKAおよびWEKAフレームワークにおける多ラベル分類(MLC)アルゴリズムの探索空間をモデル化する形式的文脈自由文法を提案し、自動化されたMLC手法の体系的実験的評価を可能にする。26種類のMLCアルゴリズム、28種類の単一ラベル分類器、10種類のメタアルゴリズムを、明示的な制約、依存関係、ハイパーパramータ設定と統合し、自動機械学習パイプラインの包括的かつ実行可能な探索空間を提供する。

ABSTRACT

This supplementary material aims to describe the proposed multi-label classification (MLC) search spaces based on the MEKA and WEKA softwares. First, we overview 26 MLC algorithms and meta-algorithms in MEKA, presenting their main characteristics, such as hyper-parameters, dependencies and constraints. Second, we review 28 single-label classification (SLC) algorithms, preprocessing algorithms and meta-algorithms in the WEKA software. These SLC algorithms were also studied because they are part of the proposed MLC search spaces. Fundamentally, this occurs due to the problem transformation nature of several MLC algorithms used in this work. These algorithms transform an MLC problem into one or several SLC problems in the first place and solve them with SLC model(s) in a next step. Therefore, understanding their main characteristics is crucial to this work. Finally, we present a formal description of the search spaces by proposing a context-free grammar that encompasses the 54 learning algorithms. This grammar basically comprehends the possible combinations, the constraints and dependencies among the learning algorithms.

研究の動機と目的

  • MEKAおよびWEKAを用いた自動多ラベル分類(MLC)手法の包括的かつ実行可能な探索空間を定義すること。
  • 26種類のMLCアルゴリズムと28種類の単一ラベル分類器の間の依存関係、制約、ハイパーパramータ設定をモデル化すること。
  • 問題変換、アルゴリズム適応、メタアルゴリズムの相互作用を形式化することで、MLCパイプラインの体系的実験的評価を可能にすること。
  • MLC構成の構造的で文法ベースの表現を提供することで、自動機械学習(AutoML)ワークフローを支援すること。

提案手法

  • MEKAおよびWEKAで使用される54種類の学習アルゴリズム(26種類のMLC、28種類のSLC、10種類のメタアルゴリズム)を形式的に記述する文脈自由文法を提案する。
  • 問題変換(PT)手法のための生成規則を定義し、ベイジアン分類器チェーン(BCC)やPMCCのような制約付きアルゴリズムのための特別な規則を含む。
  • アルゴリズム適応(AA)手法のための別個の文法規則を導入し、エポック数、隠れユニット数、学習率、モーメンタムをハイパーパramータとして持つML-BPNNを例示する。
  • 階層的規則(<META-MLC1>、<META-MLC2>、<META-MLC3>)を通じてメタアルゴリズム統合をモデル化し、どのMLCアルゴリズムがどのメタアルゴリズムと組み合わせ可能かを制約する。
  • ランダム生成関数(例:RANDOM-INT、RANDOM-REAL)を用いてハイパーパラメータ範囲を符号化し、現実的な探索空間の境界を反映する。
  • BCCが4つの特定のメタアルゴリズム(SM、RSML、EM、CM)とのみ組み合わせ可能であるなど、既知のMEKAソフトウェア制約を符号化することで、無効な構成を防ぐ。

実験結果

リサーチクエスチョン

  • RQ1MEKAおよびWEKAにおける多ラベル分類アルゴリズムの探索空間を、自動実験的評価を可能にする形式的に記述する方法は何か?
  • RQ2MLCアルゴリズムとそのメタアルゴリズムとの統合における、主な依存関係、制約、ハイパーパラメータ設定は何か?
  • RQ3MEKAフレームワーク内で有効かつ実行可能な、問題変換、アルゴリズム適応、メタアルゴリズム手法の組み合わせはどれか?
  • RQ4文脈自由文法を用いて、MLCアルゴリズム、単一ラベル分類器、メタアルゴリズムの複雑な相互作用を、実際のソフトウェア動作を反映する形でモデル化する方法は何か?
  • RQ5しきい値キャリブレーション(例:PCut1、PCutL)はMLC性能向上に果たす役割は何か?また、探索空間にどのように統合されているか?

主な発見

  • 提案された文法は、明示的な制約とハイパーパラメータ範囲を伴う54種類の学習アルゴリズム(26種類のMLC、28種類のSLC、10種類のメタアルゴリズム)を正常にモデル化した。
  • 問題変換手法(PT)はMLCアルゴリズムの84.21%(19中16)を占め、BCCやPMCCのような異なる制約レベルに対応する別個の文法規則を有する。
  • アルゴリズム適応(AA)手法として唯一モデル化されたのはML-BPNNで、4つのハイパーパラメータ(エポック数:10–1000、隠れユニット数:属性数の0.2–1.0倍、学習率:0.001–0.1、モーメンタム:0.2–0.8)を有する。
  • BaggingMLやEnsembleMLのようなメタアルゴリズムは、特定のパラメータ範囲を要する:バッチサイズパcent(10–50)、属性パーセント(10–100)で、EnsembleMLはバッチサイズに別個の範囲(52–72)を有する。
  • 文法は、BCCが4つのメタアルゴリズム(SM、RSML、EM、CM)とのみ組み合わせ可能であるなど、ソフトウェアレベルの制約を強制し、無効な構成を防止する。
  • PCut1とPCutLによるしきい値キャリブレーションが形式的に統合されており、PCut1がデフォルトとして設定され、予測ラベルの基数が学習データと一致するようにすることで予測の信頼性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。