[論文レビュー] One Class Splitting Criteria for Random Forests
本稿では、次元の呪いを克服するため、隠れた外れ値を適応的にモデル化することで、異常検出における次元の呪いに打ち勝つ、ランダムフォレストの新規1クラス分割基準を提案する。ノードごとの期待外れ値数をボリュームに応じて動的に調整することにより、構造的に整合性のある1クラスランダムフォレストを実現し、ベンチマークにおいて既存手法を上回る性能を示す。第二クラスサンプリングを必要としない強力な経験的性能を発揮する。
Random Forests (RFs) are strong machine learning tools for classification and regression. However, they remain supervised algorithms, and no extension of RFs to the one-class setting has been proposed, except for techniques based on second-class sampling. This work fills this gap by proposing a natural methodology to extend standard splitting criteria to the one-class setting, structurally generalizing RFs to one-class classification. An extensive benchmark of seven state-of-the-art anomaly detection algorithms is also presented. This empirically demonstrates the relevance of our approach.
研究の動機と目的
- ランダムフォレストの原理的1クラス拡張が不足していることに対処すること。これは、本質的に教師あり学習に依存しているためである。
- 標準の不純度基準が希釈されたインライヤー分布のため失敗する、1クラス異常検出における次元の呪いを克服すること。
- 小さな低確率領域ですら意味のあるクラス比を維持する分割基準を開発すること。
- 人工的な外れ値生成を伴わず、1つのインライヤークラスのサポートおよび密度構造を学習できるようにランダムフォレストを可能にすること。
- 提案手法を最先端の1クラス異常検出アルゴリズムと比較して、経験的に検証すること。
提案手法
- ノードのボリュームに応じて隠れた外れ値の数を関数としてモデル化することで、不純度低下のための適応的1クラスプロキシを提案し、小さな領域においても無視できない外れ値期待値を保証する。
- ノード固有のモデル One-Class-Model(n(Lt), α(Lt)) を定義し、α(Lt) と n(Lt) を調整することで、ノード間で外れ値対インライヤー比の期待値が一定に保たれるようにする。
- 2つの制約を課す:(1) インライヤーの期待数が変化しないこと:(1−α)n = (1−α(Lt))n(Lt)、(2) 期待クラス比 γt が α(Lt)n(Lt)Lt = γnt を通じて一定に保たれること。
- ボリュームおよび比に調整された外れ値期待値に基づいてスケーリングされた項を含む、2クラスGini基準の一般化として、適応的不純度低下基準 IOC−adG(tL,tR) を導出する。
- ノードボリューム Lt → 0 の漸近的極限を用いてモデルを正当化し、極限において外れ値数が発散する一方で、インライヤーがパラメータ (1−α)n のポアソン分布に従うことを示す。
- 7つの最先端の異常検出アルゴリズムを用いたベンチマークを通じて、提案手法の経験的妥当性を検証し、既存手法を上回る性能を示す。
実験結果
リサーチクエスチョン
- RQ1第二クラスサンプリングに依存せずに、標準のランダムフォレスト分割基準を1クラス設定に自然に拡張できるか?
- RQ2密度が低く次元が高いためインライヤーが希釈される領域において、不純度基準をどのように再設計すれば、識別力を維持できるか?
- RQ3隠れた外れ値モデルにどのような制約を課すことで、2クラスRFフレームワークと整合性を保ちつつ、次元の呪いを回避できるか?
- RQ4ノードボリュームが小さくなるに従って、各ノードにおける外れ値の期待割合を意味のある水準に維持するにはどうすればよいか?
- RQ5提案された適応的1クラス分割基準は、既存の最先端手法と比較して、異常検出性能を向上させるか?
主な発見
- 提案された適応的1クラス分割基準は、ノード間で一定の期待外れ値対インライヤー比を維持でき、小さな領域でも不純度基準の崩壊を防ぐことに成功した。
- 7つの最先端の異常検出アルゴリズムを用いたベンチマークにおいて、提案手法は優れた経験的性能を発揮し、既存手法を上回った。
- 適応的モデルにより、インライヤーの期待数が元のデータセットサイズと整合したままであり、統計的整合性が保たれた。
- モデルの漸近的挙動は適切に正当化された:ノードボリュームが0に近づく極限において、隠れた外れ値数は発散するが、インライヤーはパラメータ (1−α)n のポアソン分布に従う。
- 導出された基準式 (14) は、隠れた外れ値数を実際の第二クラス数に置き換えた極限において、元の2クラスGini不純度低下を回復する。
- 本手法は、人工的外れ値生成や木構造設計に対する構造的制約を回避する、ランダムフォレストの自然で構造的拡張としての1クラス分類への一般化を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。