Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study on Feature Discretization

Qiang Liu, Zhaocheng Liu|arXiv (Cornell University)|Apr 27, 2020
Neural Networks and Applications参考文献 12被引用数 4
ひとこと要約

本稿では、離散化されたボックス内で線形補間を用いることで正しさを向上させつつも、頑健性を維持する新しい特徴離散化手法であるローカル線形符号化(LLE)を提案する。HIGGSおよびSUSYデータセットにおける実験では、LLEは従来の離散化手法およびマルチグレインラティチュード離散化(MGD)を上回り、モデルパラメータ数を著しく削減することで、さまざまな学習データ比において最先端の性能を達成した。

ABSTRACT

When dealing with continuous numeric features, we usually adopt feature discretization. In this work, to find the best way to conduct feature discretization, we present some theoretical analysis, in which we focus on analyzing correctness and robustness of feature discretization. Then, we propose a novel discretization method called Local Linear Encoding (LLE). Experiments on two numeric datasets show that, LLE can outperform conventional discretization method with much fewer model parameters.

研究の動機と目的

  • 機械学習における連続的数値特徴の最適な離散化手法を特定すること。
  • 既存の離散化手法の正しさと頑健性を理論的に分析すること。
  • 正しさを向上させつつ頑健性を損なわない新しい離散化手法を提案すること。
  • MGDや一般的な離散化手法と比較して、性能を維持または向上させつつモデルの複雑さを低減すること。

提案手法

  • LLEは、各ボックスごとに標準的なワンホットエンベッディングに代わり、ボックス境界間での線形補間を用いることで、連続値の滑らかな表現を可能にする。
  • 各ボックスに対して、LLEは隣接するボックスのエンベッディングの重み付き平均として予測値を計算し、重みは特徴値の位置に基づいた線形補間から導出される。
  • LLEは、ノイズ下での予測の分散を保つことで、従来の離散化と同等の頑健性を維持する。
  • 正しさが向上するのは、LLEが真のラベルと予測値の期待二乗誤差を、元の関数をよりよく近似することで低減するためである。
  • LLEは各特徴フィールドに対して1つの学習可能な重みベクトルを用いるが、MGDは異なるグレインラティチュードごとに複数のエンベッディングを必要とする。
  • 理論的分析により、LLEは等頻度または等幅離散化よりも低い正しさ誤差を達成することが示され、特にボックスサイズが小さい場合に顕著である。

実験結果

リサーチクエスチョン

  • RQ1離散化ボックスのサイズは、特徴離散化の正しさと頑健性にどのように影響するか?
  • RQ2従来の手法と比較して、正しさを向上させつつ頑健性を損なわない離散化手法は可能か?
  • RQ3ボックス内での線形補間は、固定ボックスエンベッディングよりも優れた一般化性能をもたらすか?
  • RQ4複数のグレインラティチュードにわたる複数のエンベッディング(MGDの方法)と比較して、1つのエンベッディングで十分な性能が得られるか?
  • RQ5特徴離散化において、モデルの複雑さと性能のトレードオフは何か?

主な発見

  • LLEは、すべてのデータセットおよび学習データ比において最高の性能を達成し、共通離散化(CD)およびマルチグレインラティチュード離散化(MGD)を上回った。
  • HIGGSデータセットでは、LLEが10個のボックスを用いてDNNで87.58%の精度を達成し、同じグレインラティチュードでのMGD(87.43%)およびCD(87.28%)を上回った。
  • SUSYデータセットでは、LLEが10個のボックスを用いてDNNで86.62%の精度を達成し、同じ設定でのMGD(86.66%)およびCD(86.08%)を上回った。
  • HIGGSデータセットでは、LLEによりモデルパラメータ数がMGDの162,560からわずか198にまで削減され、パラメータ数が100倍も減少した。
  • LLEは、100%、10%、1%のさまざまな学習データ比において一貫した性能を示し、優れた一般化性能と安定性を示した。
  • 理論的分析により、LLEが予測誤差の期待値を低減することで正しさを向上させることを確認したが、従来の離散化と比較して頑健性は変化しなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。