[論文レビュー] Enhancing Multi-Class Classification of Random Forest using Random Vector Functional Neural Network and Oblique Decision Surfaces
本稿では、新規の傾斜ランダムフォレストとランダムベクターファンクショナルリンク(RVFL)ネットワークを組み合わせたハイブリッドアンサンブル分類器を提案する。RVFLを用いて訓練データをクラス固有のサブセットに分割することで、より効果的で細分化された傾斜意思決定木を実現し、標準的および傾斜ランダムフォレストと比較して、計算コストを低減しつつ優れた精度を達成する。
Both neural networks and decision trees are popular machine learning methods and are widely used to solve problems from diverse domains. These two classifiers are commonly used base classifiers in an ensemble framework. In this paper, we first present a new variant of oblique decision tree based on a linear classifier, then construct an ensemble classifier based on the fusion of a fast neural network, random vector functional link network and oblique decision trees. Random Vector Functional Link Network has an elegant closed form solution with extremely short training time. The neural network partitions each training bag (obtained using bagging) at the root level into C subsets where C is the number of classes in the dataset and subsequently, C oblique decision trees are trained on such partitions. The proposed method provides a rich insight into the data by grouping the confusing or hard to classify samples for each class and thus, provides an opportunity to employ fine-grained classification rule over the data. The performance of the ensemble classifier is evaluated on several multi-class datasets where it demonstrates a superior performance compared to other state-of- the-art classifiers.
研究の動機と目的
- 標準ランダムフォレストにおける軸に平行な分割の限界を解消するため、複雑な意思決定面をよりよく捉えることができる傾斜境界を導入すること。
- RVFLネットワークの高速かつ閉形式の学習を活用してデータ分割を行うことで、多クラス分類における計算コストを低減すること。
- 困難な高次元または多クラスデータセットにおいて、分類不能なサンプルに対して細分化された分類ルールを可能にすることで、分類性能を向上させること。
- RVFLの高速性と傾斜木の表現力の長所を組み合わせたハイブリッドアンサンブルを構築し、優れた一般化性能を達成すること。
- 浅い木構造と小さなアンサンブルサイズでも、RVFLに基づくデータ分割によって高い性能が達成できることを示し、トレーニング時間とリソース使用量を削減すること。
提案手法
- 各ノードで線形超平面(傾斜分割)を用いる新しい傾斜意思決定木の変種を提案し、ジニ不純度基準を最適化することで、標準ランダムフォレストに類似したが境界近似性能が向上した。
- クラス固有のパターンに基づき、RVFLネットワークを用いて訓練データをC個のサブセットに分割する(Cはクラス数)。
- 各RVFLによるサブセットに対してC個の傾斜意思決定木を学習させ、各クラスの分類が難しいまたは混同しやすいサンプルに焦点を当てた学習を可能にする。
- RVFLによるパーティショニングを経た傾斜ランダムフォレストの予測と元のRVFLネットワークの予測を統合することで、最終的な意思決定統合を実現するハイブリッドアンサンブル分類器(obRaFL)を構築する。
- RVFLのトレーニングに閉形式解を用いることで、バックプロパゲーションを必要とせず、極めて高速な学習が可能となり、トレーニング時間を顕著に短縮する。
- バギングを用いて複数のトレーニングバッグを生成し、各バッグ内でRVFLを用いてクラス固有のパーティショニングを実施することで、多様性と耐性を向上させる。
実験結果
リサーチクエスチョン
- RQ1RVFLによるパーティショニングを経た傾斜意思決定木は、標準的および傾斜ランダムフォレストと比較して、多クラス分類精度を向上させることができるか?
- RQ2RVFLを用いたデータパーティショニングにより、分類が難しいサンプルに対する学習がより効果的になり、一般化性能が向上するか?
- RQ3RVFLと傾斜ランダムフォレストのハイブリッドアンサンブルは、既存の最先端手法と比較して、高い精度と低い計算コストを同時に達成できるか?
- RQ4提案手法は、大規模または高次元のデータセットにおいて、トレーニング時間をどれほど短縮しつつ、性能を維持または向上させることができるか?
- RQ5木の深さ、木の数、特徴量の数といったハイパーパrameterが、提案されたハイブリッドアンサンブルの性能に与える影響はどの程度か?
主な発見
- 提案された傾斜ランダムフォレスト(obRaF(M))は10個のデータセットで平均84.36%の精度を達成し、標準ランダムフォレスト(83.07%)および傾斜ランダムフォレスト(83.68%)を上回った。
- ハイブリッドアンサンブル(obRaFL)は平均84.6%の最高精度を記録し、Friedman順位1.1を示しており、全体的な性能が優れていることを示している。
- Pendigitsデータセットでは、300本の木と最大深さ6の設定でも97.15%の精度を達成し、より深い標準フォレストを上回った。
- 本手法は浅い木構造と小さなアンサンブルサイズでも高い性能を維持でき、計算効率性を示している。
- RVFLに基づくパーティショニングは、混同しやすいサンプルをクラスごとに効果的にグループ化し、精度向上に寄与する細分化された分類ルールを可能にした。
- ハイブリッドアンサンブルは、Statlog-image(98.27%精度)やLetter(97.58%精度)といった高次元データセットを含む多様なデータセットにおいても、優れた一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。