Skip to main content
QUICK REVIEW

[論文レビュー] Under-bagging Nearest Neighbors for Imbalanced Classification

Hanyuan Hang, Yuchao Cai|arXiv (Cornell University)|Sep 1, 2021
Imbalanced Data Classification Techniques参考文献 83被引用数 7
ひとこと要約

本稿では、不均衡分類を改善するために、多数クラスからバランスの取れたブートストラップサブサンプルを生成し、各サブサンプルを少数クラスのサイズに合わせることで、不均衡な分類を向上させるアンダーバギングk近傍法(under-bagging k-NN)を提案する。理論的に、弱い滑らかさおよびマージン条件の下で、再現率の算術平均(AM)の最適収束速度を達成する。サブサンプルのサイズが小さく、バギングラウンドの数も少ないため、時間計算量が顕著に削減されつつ、競争力のある性能を維持する。

ABSTRACT

In this paper, we propose an ensemble learning algorithm called extit{under-bagging $k$-nearest neighbors} ( extit{under-bagging $k$-NN}) for imbalanced classification problems. On the theoretical side, by developing a new learning theory analysis, we show that with properly chosen parameters, i.e., the number of nearest neighbors $k$, the expected sub-sample size $s$, and the bagging rounds $B$, optimal convergence rates for under-bagging $k$-NN can be achieved under mild assumptions w.r.t.~the arithmetic mean (AM) of recalls. Moreover, we show that with a relatively small $B$, the expected sub-sample size $s$ can be much smaller than the number of training data $n$ at each bagging round, and the number of nearest neighbors $k$ can be reduced simultaneously, especially when the data are highly imbalanced, which leads to substantially lower time complexity and roughly the same space complexity. On the practical side, we conduct numerical experiments to verify the theoretical results on the benefits of the under-bagging technique by the promising AM performance and efficiency of our proposed algorithm.

研究の動機と目的

  • 標準k-NNが不均衡データセットにおいて、多数クラスが予測を支配するための性能が著しく低下する問題に対処すること。
  • k-NNのシンプルさを保ちつつ、少数クラスの再現率を向上させる理論的根拠に基づいたアンサンブル手法を開発すること。
  • より小さなサブサンプルと少ないバギングラウンドを用いることで、計算量を低減しつつ性能を損なわないようにすること。
  • ホーラー滑らかさおよびマージン条件の下で、再現率の算術平均(AM)の最適収束速度を確立すること。
  • 他のベース分類器に適用可能な、アンダーバギング技術の学習理論的基盤を提供すること。

提案手法

  • 本手法は、多数クラスから、少数クラスのサイズに等しいサイズのブートストラップサブサンプルを生成することで、k-NN分類器のアンサンブルを構築する。
  • 各バギングラウンドでは、少数クラスと多数クラスからランダムに抽出されたサブサンプルを組み合わせて、バランスの取れた訓練セットを形成する。
  • 最終的な予測は、アンサンブル内のすべてのベース分類器の後方確率の平均によって得られる。
  • 理論的分析は、真の回帰関数のホーラー滑らかさとマージン条件に依存し、収束速度を導出する。
  • 主なパラメータには、近傍数$k$、サブサンプルサイズ$s$、バギングラウンド数$B$があり、収束性を最適化するために調整される。
  • モデル学習を回避することで、k-NNのラジカルラーニングの性質を保ちつつ、クラス不均衡に対するロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1アンダーバギングk-NNは、不均衡分類において再現率の算術平均(AM)の最適収束速度を達成できるか?
  • RQ2サブサンプルサイズ$s$とバギングラウンド数$B$の選択が、収束速度および計算量にどのように影響するか?
  • RQ3アンダーバギングk-NNは、著しく低い時間計算量で標準k-NNと同等の性能を達成できるか?
  • RQ4弱い滑らかさおよびマージン条件の下で、アンダーバギングk-NNに対してどのような理論的保証を確立できるか?
  • RQ5アンダーバギングは、極めて不均衡なデータセットにおけるk-NNの一般化性能を向上させるか?

主な発見

  • アンダーバギングk-NNは、ホーラー滑らかさおよびマージン条件の下で、再現率の算術平均(AM)の最適収束速度$\mathcal{O}\bigl((\log n/n)^{\alpha/(2\alpha+d)}\bigr)$を達成する。
  • 適切に選ばれたパラメータのもとで、期待されるサブサンプルサイズ$s$は、全訓練サイズ$n$よりも著しく小さくでき、時間計算量が顕著に削減される。
  • 極めて不均衡な状況下では、近傍数$k$を同時に小さくすることで、計算コストをさらに低減できる。
  • 空間計算量は標準k-NNとほぼ同等を維持しつつ、より高い効率性と性能を達成する。
  • $d > 2\alpha$の場合、収束速度は$\mathcal{O}\bigl((\log^2(Mn_{(1)})/Mn_{(1)})^{\alpha/(2\alpha+d)}\bigr)$となるが、弱い仮定のもとで$\mathcal{O}\bigl((\log n/n)^{\alpha/(2\alpha+d)}\bigr)$に簡略化される。
  • 理論的分析により、アンダーバギングk-NNが比較的小さな$B$でも最適な収束速度を達成できることを確認し、大規模な不均衡データセットにおいてスケーラブルかつ実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。