Skip to main content
QUICK REVIEW

[論文レビュー] Deep Broad Learning - Big Models for Big Data

Nayyar A. Zaidi, Geoffrey I. Webb|arXiv (Cornell University)|Sep 4, 2015
Neural Networks and Applications参考文献 18被引用数 5
ひとこと要約

本論文は、複雑な高次相互作用をモデル化できる深層学習の能力と、多数の特徴量を活用できるブロードラーニングの能力を組み合わせた、新たなアルゴリズムであるDeep Broad Learning (DBL)を提案する。$n$次までのロジスティック回帰モデルを効率的に最適化するハイブリッド生成的・判別的アプローチを用いることで、最小限のチューニングで大規模データに対して最先端の精度を達成し、アウト・オブ・コア学習をサポートする。Poker-handやCensus-incomeを含む大規模データセットにおいて、非常に競争力のある性能を示している。

ABSTRACT

Deep learning has demonstrated the power of detailed modeling of complex high-order (multivariate) interactions in data. For some learning tasks there is power in learning models that are not only Deep but also Broad. By Broad, we mean models that incorporate evidence from large numbers of features. This is of especial value in applications where many different features and combinations of features all carry small amounts of information about the class. The most accurate models will integrate all that information. In this paper, we propose an algorithm for Deep Broad Learning called DBL. The proposed algorithm has a tunable parameter $n$, that specifies the depth of the model. It provides straightforward paths towards out-of-core learning for large data. We demonstrate that DBL learns models from large quantities of data with accuracy that is highly competitive with the state-of-the-art.

研究の動機と目的

  • 大規模データ向けの高精度なモデル構築の課題に、複雑な相互作用をモデル化できる深層学習の能力と、多数の特徴量を活用できるブロードラーニングの能力を組み合わせることで対処すること。
  • 個々の特徴量がターゲットクラスについてわずかな情報をしか持たない場合でも、効率的に大規模データセットを処理できるスケーラブルな学習アルゴリズムの開発。
  • 調整可能な深さ$n$と確率的勾配降下法による効率的なパrameter最適化を備えたモデルを設計することで、大規模データセットに対するアウト・オブ・コア学習を可能にすること。
  • ハイブリッド生成的・判別的学習が、最小限のハイパーパrameterチューニングで高い精度を達成できることを示し、従来のモデルを上回ることを実証すること。

提案手法

  • すべての$n$次特徴量相互作用($n=1$ から $n=3$ まで)をモデル化できる、ロジスティック回帰を拡張した深層的ブロードラーニングフレームワークであるDBL$^n$を提案する。
  • ハイブリッド生成的・判別的アプローチを採用:判別的ロジスティック回帰を、生成的最尤推定値で事前条件付けすることで収束を加速する。
  • 効率的な最適化のため確率的勾配降下法(SGD)を採用し、グローバル最小値への高速収束を実現するとともに、アウト・オブ・コア学習をサポートする。
  • $n=1$ から $n$ までのモデルを統合する階層的拡張$h\text{DBL}^n$を導入し、高次相互作用がトレーニングデータに存在しない場合でも、低次相互作用にフォールバックできるようにする。
  • 高次相互作用を効率的に処理するため、スパース実装技術を適用する。特に、多くの組み合わせがデータに存在しない場合に有効である。
  • 現在のバージョンではカテゴリカルデータのみをサポートしており、モデリングの前段階で数値特徴量を離散化する必要がある。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッド生成的・判別的アプローチは、大規模データ向けの高次ロジスティック回帰モデル($\text{LR}^n$)を効率的に最適化できるか?
  • RQ2複雑な多次元相互作用を捉える深く広い学習モデルは、大規模データセットにおいて最先端のモデルを上回る精度を達成できるか?
  • RQ3提案されたDBLフレームワークは、効率的なSGD最適化により、非常に大規模なデータセットにスケーリングし、アウト・オブ・コア学習をサポートできるか?
  • RQ4特徴量が微小な証拠しか持たない場合でも、DBL$^n$の性能はランダムフォレストやその他のアンサンブル手法と比較して優れているか?
  • RQ5高次相互作用がトレーニングデータに存在しない場合でも、$n$次相互作用の階層的モデリングが、モデルのロバストネスを向上させられるか?

主な発見

  • DBL$^3$はMIT-FaceSetCデータセットで0-1損失が最小(0.0005)を記録し、全8つの大規模データセットのうち6つで2番目に良い結果を達成。ランダムフォレストやA2DEを上回った。
  • Census-incomeデータセットでは、DBL$^3$が0-1損失0.0056を達成し、A2DE(0.01348)やRF(0.0687)を著しく上回った。
  • MIT-FaceSetBデータセットではDBL$^2$がRMSEが最小(0.0123)を記録し、全8データセットのうち5つで2番目に良い結果を達成。RFやA2DEを上回った。
  • Kddcupデータセットでは、DBL$^3$が0-1損失0.0013、RMSE 0.1494を達成。両方とも最高水準の結果であり、RFやA2DEを上回った。
  • DBL$^1$(WANBIA-Cに等価)は、いくつかのデータセットで競争力ある性能を示し、ハイブリッドアプローチの基盤を妥当性あるものとして裏付けた。
  • 最小限のチューニングで高速収束を示し、確率的勾配降下法による大規模かつアウト・オブ・コア学習に適していることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。