Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Kernel Machines using Deep Learning

Huan Song, Jayaraman J. Thiagarajan|arXiv (Cornell University)|Nov 15, 2017
Domain Adaptation and Few-Shot Learning参考文献 41被引用数 3
ひとこと要約

本稿では、Nyström近似を用いて得られるアンサンブル埋め込みからタスク固有の表現を学習する深層学習を活用して、カーネルマシンを最適化するフレームワークDKMO(Deep Kernel Machine Optimization)を提案する。エンド・ツー・エンドの学習が可能であり、カーネルドロップアウト正則化を適用することで、限られたデータセット上での複数カーネル学習において、従来のSVMやMKL手法を凌駕する最先端の性能を達成する。

ABSTRACT

Building highly non-linear and non-parametric models is central to several state-of-the-art machine learning systems. Kernel methods form an important class of techniques that induce a reproducing kernel Hilbert space (RKHS) for inferring non-linear models through the construction of similarity functions from data. These methods are particularly preferred in cases where the training data sizes are limited and when prior knowledge of the data similarities is available. Despite their usefulness, they are limited by the computational complexity and their inability to support end-to-end learning with a task-specific objective. On the other hand, deep neural networks have become the de facto solution for end-to-end inference in several learning paradigms. In this article, we explore the idea of using deep architectures to perform kernel machine optimization, for both computational efficiency and end-to-end inferencing. To this end, we develop the DKMO (Deep Kernel Machine Optimization) framework, that creates an ensemble of dense embeddings using Nystrom kernel approximations and utilizes deep learning to generate task-specific representations through the fusion of the embeddings. Intuitively, the filters of the network are trained to fuse information from an ensemble of linear subspaces in the RKHS. Furthermore, we introduce the kernel dropout regularization to enable improved training convergence. Finally, we extend this framework to the multiple kernel case, by coupling a global fusion layer with pre-trained deep kernel machines for each of the constituent kernels. Using case studies with limited training data, and lack of explicit feature sources, we demonstrate the effectiveness of our framework over conventional model inferencing techniques.

研究の動機と目的

  • カーネル法の限界、特に高い計算コストとエンド・ツー・エンド学習の欠如を解消するため、表現学習に深層学習を統合する。
  • RKHS内の複数のカーネル由来の部分空間から、深層ニューラルネットワークを用いてタスク固有の表現学習を可能にする。
  • カーネルドロップアウト正則化を導入することで、低データ環境におけるモデルの一般化性能と収束性を向上させる。
  • 各ベースカーネルに対して事前学習済みの深層カーネルマシンとグローバル統合層を結合することで、複数カーネル学習へのフレームワークの拡張を図る。
  • 限られた学習データを有する実世界のデータセットにおいて、従来のカーネル法および最先端のMKL技術を上回る優れた性能を示す。

提案手法

  • カーネルグラム行列の低ランク近似としてのNyström法を用い、複数のカーネル行列から密な埋め込みを構築する。
  • RKHS内の異なる線形部分空間から得られる埋め込みのアンサンブルを統合することで、タスク固有の表現を学習する深層ニューラルネットワークを採用する。
  • カーネルドロップアウト正則化を導入し、学習中にランダムにカーネル部分空間をマスクすることで、一般化性能の向上とカーネル統合の模倣を実現する。
  • 各ベースカーネルに対して事前学習済みの深層カーネルマシンとグローバル統合層を結合することで、複数カーネル学習への適用を実現する。
  • RBF、カイ二乗(χ²)、相関ベースのカーネルを用いて多様な特徴表現を生成し、固有値のしきい値による処理により正定値性を保証する。
  • バックプロパゲーションを用いてネットワークをエンド・ツー・エンドで学習させ、カーネル表現とモデルパラメータの共同最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1深層学習を用いて、一般化性能と計算効率を向上させるカーネルマシンの最適化は可能か?
  • RQ2複数のカーネル部分空間からの深層表現学習を活用することで、カーネル法におけるエンド・ツー・エンド学習をどのように実現できるか?
  • RQ3カーネルドロップアウト正則化は、カーネルマシン最適化における収束性と性能を向上させるか?
  • RQ4提案されたフレームワークは、限られたデータタスクにおいて、従来のカーネル法および最先端の複数カーネル学習技術を上回る性能を示せるか?
  • RQ5深層ニューラルネットワークによる複数カーネル表現の統合は、分類境界の分離性と分類精度の向上にどの程度効果的か?

主な発見

  • M-DKMOフレームワークは、USC-HADデータセットで90.4%の精度を達成し、均一なカーネル統合ベースライン(89.0%)および最先端のUFO-MKL(87.1%)を大きく上回った。
  • 統計特徴ではカーネルSVMを4.5%、形状特徴では3.5%、相関特徴では4.6%上回り、すべての特徴タイプで一貫した向上を示した。
  • FCNモデルは形状特徴および相関特徴で性能が低く、全体の統合性能を引き下げていたが、M-DKMOはすべての特徴源で強力で一貫した改善を維持した。
  • t-SNE可視化では、Sitting、Standing、Elevator Up、Elevator Downといった困難なクラスについて、M-DKMOが個々のカーネルよりも優れたクラス分離を達成した。
  • カーネルドロップアウト正則化により、学習の収束性が向上し、補完的である部分空間の有効な統合が可能になり、微分可能でバックプロパゲーションに基づくフレームワーク内でMKLの挙動を模倣した。
  • 限られた学習データと明示的な特徴源のないデータセットにおいても、フレームワークは頑健な性能を示し、低データ環境における実用性を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。