Skip to main content
QUICK REVIEW

[論文レビュー] On the Effectiveness of Discretizing Quantitative Attributes in Linear Classifiers

Nayyar A. Zaidi, Yang Du|arXiv (Cornell University)|Jan 24, 2017
Neural Networks and Applications参考文献 21被引用数 5
ひとこと要約

本論文は、連続的属性の離散化が線形分類器における表現バイアスを顕著に低減し、特に大規模データセットにおいてより柔軟な決定境界を可能にすることで、精度を向上させることを示している。情報損失があるにもかかわらず、ロジスティック回帰、サポートベクタ分類器、ニューラルネットワークのあらゆる分野で性能向上が見られ、42のベンチマークデータセットを用いた検証で裏付けられている。

ABSTRACT

Learning algorithms that learn linear models often have high representation bias on real-world problems. In this paper, we show that this representation bias can be greatly reduced by discretization. Discretization is a common procedure in machine learning that is used to convert a quantitative attribute into a qualitative one. It is often motivated by the limitation of some learners to qualitative data. Discretization loses information, as fewer distinctions between instances are possible using discretized data relative to undiscretized data. In consequence, where discretization is not essential, it might appear desirable to avoid it. However, it has been shown that discretization often substantially reduces the error of the linear generative Bayesian classifier naive Bayes. This motivates a systematic study of the effectiveness of discretizing quantitative attributes for other linear classifiers. In this work, we study the effect of discretization on the performance of linear classifiers optimizing three distinct discriminative objective functions --- logistic regression (optimizing negative log-likelihood), support vector classifiers (optimizing hinge loss) and a zero-hidden layer artificial neural network (optimizing mean-square-error). We show that discretization can greatly increase the accuracy of these linear discriminative learners by reducing their representation bias, especially on big datasets. We substantiate our claims with an empirical study on $42$ benchmark datasets.

研究の動機と目的

  • 連続的属性の離散化が線形分類器における表現バイアスを低減できるかどうかを調査すること。
  • ロジスティック回帰、サポートベクタ分類器、ニューラルネットワークを含む複数の線形判別モデルにおける離散化の有効性を評価すること。
  • 情報損失があるにもかかわらず、離散化が一般化誤差を低減する条件を特定すること。
  • 線形モデルにおけるバイアス-バリアンストレードオフを分析し、離散化がこのバランスにどのように影響するかを評価すること。
  • 多様な実世界のデータセットにおける離散化の影響について、実証的証拠を提供すること。

提案手法

  • 連続値を離散的区間に変換するために、等頻度ヒストグラム(equal-frequency binning)を用いて連続的属性を離散化する。
  • 3つの線形判別モデルを訓練する:ロジスティック回帰(負の対数尤度を最小化)、サポートベクタ分類器(ヒンジ損失を最小化)、ゼロ隠れ層ニューラルネットワーク(平均二乗誤差を最小化)。
  • 元の連続データと離散化済みデータの両方でモデルを訓練し、性能とバイアス低減の違いを比較する。
  • バイアス-バリアンス分解を用いて、離散化がモデルの一般化に与える影響を分析する。
  • UCIやその他のソースからの42のベンチマークデータセットを用いて、多様な分野とサイズをカバーする実証的評価を実施する。
  • 観察された性能向上がデータセット全体で統計的に有意であるかを検証するため、有意性検定を適用する。

実験結果

リサーチクエスチョン

  • RQ1連続的属性の離散化は、特に大規模データセットにおいて、線形分類器における表現バイアスを低減するか?
  • RQ2離散化は、ロジスティック回帰、サポートベクタ分類器、ニューラルネットワークの性能にどのように影響するか?
  • RQ3情報損失があるにもかかわらず、離散化が一般化誤差を低減する条件は何か?
  • RQ4離散化は線形モデルにおけるバイアス-バリアンストレードオフをどのようにシフトさせるか?
  • RQ5離散化による性能向上は、異なるデータサイズや分野において一貫しているか?

主な発見

  • 離散化は、特に過学習が最小限に抑えられる大規模データセットにおいて、線形分類器における表現バイアスを顕著に低減する。
  • 離散化による性能向上は、ロジスティック回帰とサポートベクタ分類器で最も顕著であり、42のベンチマークデータセット全体で一貫した精度向上が確認された。
  • ゼロ隠れ層ニューラルネットワークでは、離散化により線形分離のみでは得られないより複雑な決定境界を実現でき、精度が向上した。
  • 離散化によるバイアス低減は、しばしばテスト誤差の低減に繋がり、特に分散の増加を相殺できる十分なデータサイズがある場合に顕著である。
  • 元のデータ分布が非線形である場合、離散化により線形モデルが非線形の決定境界を近似可能になるため、その恩恵が顕著に現れる。
  • 実証的結果から、情報の一部を失うにもかかわらず、実世界の設定では離散化が連続的モデリングを上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。