Skip to main content
QUICK REVIEW

[論文レビュー] Classification Logit Two-sample Testing by Neural Networks

Xiuyuan Cheng, Alexander Cloninger|arXiv (Cornell University)|Sep 25, 2019
Model Reduction and Neural Networks参考文献 61被引用数 8
ひとこと要約

本稿では、テストデータセット上で訓練された分類器のロジット関数の差を用いた、ニューラルネットワークベースの2標本検定を提案する。特に、部分指数分布に対して一貫した検出力の理論的証明を行い、データが低次元多様体に近接する場合、ネットワークの複雑さが埋め込み次元ではなく、本質的次元にのみ依存することを示し、実験では従来のニューラルネットワークおよびカーネルベース手法を上回る性能を発揮する。

ABSTRACT

The recent success of generative adversarial networks and variational learning suggests training a classifier network may work well in addressing the classical two-sample problem. Network-based tests have the computational advantage that the algorithm scales to large samples. This paper proposes a two-sample statistic which is the difference of the logit function, provided by a trained classification neural network, evaluated on the testing set split of the two datasets. Theoretically, we prove the testing power to differentiate two sub-exponential densities given that the network is sufficiently parametrized. When the two densities lie on or near to low-dimensional manifolds embedded in possibly high-dimensional space, the needed network complexity is reduced to only scale with the intrinsic dimensionality. Both the approximation and estimation error analysis are based on a new result of near-manifold integral approximation. In experiments, the proposed method demonstrates better performance than previous network-based tests using classification accuracy as the two-sample statistic, and compares favorably to certain kernel maximum mean discrepancy tests on synthetic datasets and hand-written digit datasets.

研究の動機と目的

  • 高次元データにおけるスケーラビリティとパフォーマンスの向上を図るため、ディープラーニングを用いた古典的2標本問題の解決。
  • 高次元または大標本において性能が著しく低下する、従来のカーネルベース検定(例:MMD)の限界を克服すること。
  • 訓練済み分類ニューラルネットワークをコア統計量として用いる、理論的裏付けがありスケーラブルな2標本検定の開発。
  • 分布が低次元多様体に近接する場合、ネットワークの複雑さが埋め込み次元ではなく、本質的次元にのみ依存することの証明。
  • 近似誤差と推定誤差を解析するための、近多様体積分近似に基づく新規理論枠組みの構築。

提案手法

  • 2つの分布のデータを統合し、交差エントロピー損失(Jensen-Shannon発散の最小化に等価)を用いて深層ニューラルネットワーク分類器を訓練する。
  • テストセット上の2つのグループ間の平均ロジット値(オッズの対数)の差を、検定統計量として計算する。
  • 推定誤差を制御するため、新規の近多様体積分近似結果に基づく一般化誤差境界を用いる。
  • 十分に広く深く、かつ本質的次元に比例する誤差で最適ロジット関数を近似可能なネットワークが存在することを示し、近似誤差の境界を確立する。
  • Lipschitz関数に対する濃縮不等式と被覆論理を用いて、経験的期待値と真の期待値の乖離を境界付ける。
  • ロジット差統計量がi.i.d.の部分指数分布に従うことを活用し、中心極限定理に基づく分散制御により検出力の保証を可能にする。

実験結果

リサーチクエスチョン

  • RQ1訓練済みニューラルネットワーク分類器が、統計的に強力でスケーラブルな2標本検定統計量を提供できるか?
  • RQ2必要なネットワークの複雑さは、埋め込み次元ではなく、データ多様体の本質的次元にのみ依存するか?
  • RQ3ニューラルネットワーク分類器の近似誤差が、2標本問題における検出力にどのように影響するか?
  • RQ4提案手法のロジットベース検定は、カーネルMMDや正答率ベースのニューラルネットワーク検定を上回る性能を示せるか?
  • RQ5部分指数尾の仮定の下で、検定の一貫性と検出力について、どのような理論的保証を確立できるか?

主な発見

  • 提案手法のロジットベース検定は、分類正答率を統計量とする従来のニューラルネットワーク手法よりも高い統計的検出力を達成する。
  • 合成多様体データおよびMNIST数字生成タスクにおいて、ガウスカーネルMMDを上回り、特に高次元設定で顕著な優位性を示す。
  • 理論的解析により、分布が低次元多様体に近接する場合、ネットワークの複雑さが埋め込み次元ではなく、本質的次元にのみ依存することが示された。
  • 推定誤差は、本質的次元と標本サイズに依存する項で境界づけられ、具体的には $ O((\text{log } n / n)^{1/(2+d)}) $ となる。ここで $ d $ は本質的次元を表す。
  • 近似誤差は、有界なリーマン数を持つ多様体上での積分の近似に関する新規な近多様体積分近似結果により制御され、その結果、多様体上の積分の乖離が境界づけられる。
  • 帰無仮説の下で、検定統計量は漸近的に正規分布に従い、その分散はネットワークのLipschitz定数に依存する定数で境界づけられるため、信頼性の高い推論が可能となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。