Skip to main content
QUICK REVIEW

[論文レビュー] On the Fine-Grained Complexity of Empirical Risk Minimization: Kernel Methods and Neural Networks

Artūrs Bačkurs, Piotr Indyk|arXiv (Cornell University)|Apr 10, 2017
Machine Learning and Algorithms被引用数 14
ひとこと要約

この論文は、細粒度計算複雑性理論を用いて、カーネル法およびニューラルネットワークにおける経験的リスク最小化(ERM)の条件的下界を確立する。強い指数時間仮説(SETH)のもとで、カーネルSVM、カーネルリッジ回帰、あるいはニューラルネットワークの最終層の学習を高精度で部分二次時間で解くことは不可能であり、また、このようなモデルにおける勾配計算もO(n·m)時間より著しく高速化できないことを証明する。

ABSTRACT

Empirical risk minimization (ERM) is ubiquitous in machine learning and underlies most supervised learning methods. While there has been a large body of work on algorithms for various ERM problems, the exact computational complexity of ERM is still not understood. We address this issue for multiple popular ERM problems including kernel SVMs, kernel ridge regression, and training the final layer of a neural network. In particular, we give conditional hardness results for these problems based on complexity-theoretic assumptions such as the Strong Exponential Time Hypothesis. Under these assumptions, we show that there are no algorithms that solve the aforementioned ERM problems to high accuracy in sub-quadratic time. We also give similar hardness results for computing the gradient of the empirical loss, which is the main computational burden in many non-convex learning tasks.

研究の動機と目的

  • カーネル法およびニューラルネットワークにおける経験的リスク最小化(ERM)の正確な計算複雑性を理解すること。
  • カーネルSVMやカーネルリッジ回帰のような一般的なモデルにおいて、高精度なERM解が部分二次時間で計算可能かどうかを特定すること。
  • 細粒度計算複雑性の仮定のもとで、ニューラルネットワークにおける勾配計算の複雑性、特に最終層についての調査。
  • 細粒度複雑性における標準的仮定である強い指数時間仮説(SETH)に基づく条件的下界を提示すること。
  • 既存の方法の実用的非効率性と多項式時間アルゴリズムのギャップを埋めるために、二次時間より優れた性能が、広く信じられている複雑性仮定が破綻しない限り、不可能であることを示すこと。

提案手法

  • 特に強い指数時間仮説(SETH)を用いた細粒度計算複雑性理論を活用し、ERMおよび勾配計算における条件的下界を導出する。
  • 二値ベクトルを入力空間に精密に埋め込むことで、充足可能性問題(CNF-SAT)をカーネル法およびニューラルネットワークにおけるERM問題に還元する。
  • 凸性、有界性、およびゼロにおける一意の最小値という性質を持つ損失関数を構築し、元の計算問題の構造を保持する。
  • 入力空間における直交するベクトルのペアが大きな損失値に対応し、非直交ペアが小さな損失をもたらすような行列構造を用意し、CNF-SATからERMへの還元を可能にする。
  • 双対変数αの異なる割り当てにおける経験的リスクの振る舞いを分析し、最適解が直交ペアの存在に一致することを示す。
  • 任意のアルゴリズムが高精度でERM問題を解くには、本質的に元のCNF-SATインスタンスを解く必要があることから、部分二次時間アルゴリズムが存在すればSETHに反する、と証明する。

実験結果

リサーチクエスチョン

  • RQ1標準的な複雑性仮定のもとで、カーネルSVMは部分二次時間で高精度に解けるか?
  • RQ2ニューラルネットワークの最終層における経験的損失の勾配をO(n·m)時間より速く計算するアルゴリズムは存在するか?
  • RQ3SETHを仮定した場合、カーネルリッジ回帰は二次時間より効率的に解けるか?
  • RQ4カーネル法およびニューラルネットワークにおけるERMの計算複雑性は、本質的な難易度ゆえに二次的にスケーリングするのか、それとも非効率なアルゴリズムによるものか?
  • RQ5各例を個別に処理する以上のスピードアップは、深層学習モデルにおける勾配計算に根本的な限界があるのか?

主な発見

  • 強い指数時間仮説(SETH)のもとでは、カーネルSVMを高精度に部分二次時間で解くアルゴリズムは存在しない。
  • 同様の下界はカーネルリッジ回帰およびニューラルネットワークの最終層の学習に対しても成立し、これらの問題は例の数に対して本質的に二次的であることを示唆する。
  • ニューラルネットワークの最終層における経験的損失の勾配計算は、nがユニット数、mが例の数であるとき、O(n·m)時間より速く行うことはできない(SETHが成り立たない限り)。
  • 同じ複雑性仮定のもとで、いかなるアルゴリズムも、各例を個別に処理するよりも著しく速くミニバッチ勾配を計算することはできない。
  • 下界は条件的ではあるが、SETHのような細粒度複雑性において広く受け入れられている予想に基づいており、数十年にわたるアルゴリズム研究の検証を経てきている。
  • これらの結果は、高精度なERMおよび勾配計算の計算コストが、アルゴリズムの非効率性に起因するのではなく、データの本質的構造に起因する根本的な制限によって規定されていることを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。