Skip to main content
QUICK REVIEW

[論文レビュー] The Boundary Forest Algorithm for Online Supervised and Unsupervised Learning

Charles Mathy, Nate Derbinsky|arXiv (Cornell University)|May 12, 2015
Machine Learning and Data Classification参考文献 15被引用数 8
ひとこと要約

Boundary Forest (BF)アルゴリズムは、教師ありおよび教師なしの設定において、高速で段階的な学習と照合を可能にする、新しいオンラインインスタンスベースの学習手法である。この手法は、学習時間のスケーリングをO(DN log N)、推論時間のスケーリングをO(D log N)に抑え、最先端の手法を上回る速度を達成しながら、ベンチマークデータセット上でのk-NNの精度と同等の性能を示しており、リアルタイムストリーミング応用に最適である。

ABSTRACT

We describe a new instance-based learning algorithm called the Boundary Forest (BF) algorithm, that can be used for supervised and unsupervised learning. The algorithm builds a forest of trees whose nodes store previously seen examples. It can be shown data points one at a time and updates itself incrementally, hence it is naturally online. Few instance-based algorithms have this property while being simultaneously fast, which the BF is. This is crucial for applications where one needs to respond to input data in real time. The number of children of each node is not set beforehand but obtained from the training procedure, which makes the algorithm very flexible with regards to what data manifolds it can learn. We test its generalization performance and speed on a range of benchmark datasets and detail in which settings it outperforms the state of the art. Empirically we find that training time scales as O(DNlog(N)) and testing as O(Dlog(N)), where D is the dimensionality and N the amount of data,

研究の動機と目的

  • リアルタイムで段階的な学習を可能にし、低遅延の学習と推論を実現する学習アルゴリズムの開発。
  • バッチ処理を必要とせず、高次元のデータストリームにおいても高速でスケーラブルな学習を実現すること。
  • オンライン更新をサポートしながら、k-NNと同等の高い汎化性能を維持すること。
  • 任意のデータ多様体やクラス境界に適応可能な柔軟で非パrametricな構造の提供。
  • 既存のオンラインツリーベースおよび最近傍探索手法を上回る速度とスケーラビリティを実現すること。

提案手法

  • アルゴリズムは、各ノードに訓練例を格納し、メトリック距離に基づいてエッジを形成するデータ駆動型の境界木(BT)の集合を構築する。
  • 各木は、データポイントを1つずつ挿入することで構築され、既存のノードに近いノードを選択することで、再訓練を必要とせずにオンライン学習が可能になる。
  • ノードの子供数は訓練中に動的に決定され、複雑なデータ多様体に柔軟に適応できる。
  • 効率的な木の走査と更新を実現するため、ユークリッド距離などのメトリックに基づく比較を用いることで、対数時間オーダーの照合が可能になる。
  • コンデンセッド最近傍ニューロンの原理の変種を用いてデータ圧縮を実施し、分類精度を向上させる点のみを格納する。
  • 同じ基本構造を用いて分類、回帰、最近傍検索のすべてに対応可能である。

実験結果

リサーチクエスチョン

  • RQ1インスタンスベースの学習アルゴリズムは、大規模スケールで高速なオンライン学習と低遅延推論を両立できるか?
  • RQ2Boundary Forestの性能は、k-NN、ランダムフォレスト、カバーツリーと比較して、精度と速度の面でどの程度異なるか?
  • RQ3アルゴリズムのオンライン性が、オフラインベースラインと比較して一般化性能にどの程度影響を与えるか?
  • RQ4データ次元数とサイズの増加に伴って、アルゴリズムのスケーリング特性はどのように変化するか?
  • RQ5知的なデータ選択により、訓練データのわずか一部のみを用いても、高い精度を維持できるか?

主な発見

  • Boundary Forestは、学習時間のスケーリングをO(DN log N)、推論時間のスケーリングをO(D log N)に抑え、どちらの段階でもナイーブk-NNを著しく上回る。
  • 分類ベンチマークにおいて、BFの誤差率はk-NNと同等であり、オフラインBFはオンライン版と比較してわずかに良い性能(誤差率上昇が10%未満)を示した。
  • BFの学習時間はランダムフォレスト(RF)よりも著しく速く、テストしたすべてのデータセットでナイーブk-NNの学習・推論時間の一部にまで短縮された。
  • BF-4(4コア版)では、dnaデータセットの学習時間を0.15秒にまで短縮したが、RFは3.64秒、1コア版BFは0.34秒であった。
  • mnistデータセットでは、BFは学習に103.9秒、推論に23.9秒を要したが、RFは学習に310秒、推論に0.3秒を要した。これにより、BFの学習効率の優位性が明確になった。
  • RFは推論が速いが、BFの総合的な学習・推論コストははるかに低く、ストリーミング応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。