Skip to main content
QUICK REVIEW

[論文レビュー] Quantum-Assisted Feature Selection for Vehicle Price Prediction Modeling

David Von Dollen, Florian Neukart|arXiv (Cornell University)|Apr 8, 2021
Energy, Environment, and Transportation Policies参考文献 26被引用数 6
ひとこと要約

本稿では、バイナリ二次最適化を用いて最適な特徴量サブセットを特定することで、車両価格予測のための量子支援特徴選択手法を提案する。ピアソン積率相関係数(PCC)などの相関係数を量子アニーリングフレームワークに埋め込むことで、入力次元を低減し、モデル性能を向上させる。実世界のデータにおいては、平均絶対誤差が1471.02 ± 135.6に達し、再帰的特徴量削除(1678.3 ± 143.7)といった古典的手法を上回る性能を示した。

ABSTRACT

Within machine learning model evaluation regimes, feature selection is a technique to reduce model complexity and improve model performance in regards to generalization, model fit, and accuracy of prediction. However, the search over the space of features to find the subset of $k$ optimal features is a known NP-Hard problem. In this work, we study metrics for encoding the combinatorial search as a binary quadratic model, such as Generalized Mean Information Coefficient and Pearson Correlation Coefficient in application to the underlying regression problem of price prediction. We investigate trade-offs in the form of run-times and model performance, of leveraging quantum-assisted vs. classical subroutines for the combinatorial search, using minimum redundancy maximal relevancy as the heuristic for our approach. We achieve accuracy scores of 0.9 (in the range of [0,1]) for finding optimal subsets on synthetic data using a new metric that we define. We test and cross-validate predictive models on a real-world problem of price prediction, and show a performance improvement of mean absolute error scores for our quantum-assisted method $(1471.02 \pm{135.6})$, vs. similar methodologies such as recursive feature elimination $(1678.3 \pm{143.7})$. Our findings show that by leveraging quantum-assisted routines we find solutions that increase the quality of predictive model output while reducing the input dimensionality to the learning algorithm on synthetic and real-world data.

研究の動機と目的

  • 機械学習パイプラインにおける特徴選択のNP困難な組合せ最適化課題に対処すること。
  • 実行時間と予測精度の観点から、古典的手法と比較して量子支援ルーチンの有効性を評価すること。
  • 特徴選択問題をバイナリ二次モデルとして定式化する際、PCC、MIC、GMICといった異なる相関係数指標の有効性を調査すること。
  • 合成データ(Friedman 1)と実世界データ(UCI Auto)の両方を用いて、車両価格予測の文脈で手法を検証すること。
  • 量子支援特徴選択が古典的ベースラインを上回るモデル性能と低誤差率を達成できることを示すこと。

提案手法

  • ピアソン積率相関係数(PCC)、最大情報係数(MIC)、一般化平均情報係数(GMIC)などの指標を用いて、特徴選択問題をバイナリ二次モデル(QUBO)として定式化する。
  • 特徴量の目的変数との関連性と、ペアワイズ相関の低さの両立を図るため、最大関連最小冗長性(MRMR)ヒューリスティックを適用する。
  • D-Waveを用いた量子アニーリングによりQUBO定式化を解き、古典的手法よりも効率的に組合せ的特徴空間を探索可能にする。
  • 線形回帰と勾配ブースティング回帰木(GBR)といった複数の学習アルゴリズムを用いて、選択された特徴量サブセットの予測性能を評価する。
  • 交差検証と平均絶対誤差(MAE)およびサブセット正解率といった指標を用い、量子支援と古典的手法の特徴選択を比較する。
  • サブセットサイズkを最適化するためのハイパーパrameter α と λ を調整し、今後の研究でベイズ最適化による自動調整が可能であると想定する。

実験結果

リサーチクエスチョン

  • RQ1量子支援最適化は、車両価格予測の文脈で、予測精度とモデル一般化性能の観点から古典的手法を上回ることができるか?
  • RQ2PCC、MIC、GMICといった異なる相関係数指標は、QUBO定式化において特徴量の関連性と冗長性をどの程度適切に表現できるか?
  • RQ3量子アニーリングと古典的CPUベースのルーチンの間で、実行時間効率とモデル性能のトレードオフはどのようなものか?
  • RQ4量子支援アプローチは、古典的ベースラインを上回るモデル性能を発揮する最適な特徴量サブセットサイズ(k)を同定できるか?
  • RQ5次元削減を実現しながらも元の特徴空間を保持することで、量子特徴選択がモデルの解釈性を向上させられるか?

主な発見

  • QUBO定式化にPCCを用いた量子支援手法は、合成データ(Friedman 1)においてk = 5の条件下で、MAEが2.27 ± 0.12という最低水準に達した。
  • 実世界のUCI Autoデータセットでは、QPCC-GBR手法がMAE 1471.02 ± 135.6を達成し、再帰的特徴量削除(1678.3 ± 143.7)を上回った。
  • 量子支援手法は合成データにおいてサブセット正解率0.9を達成し、最適な特徴量サブセットを高精度に同定していることが示された。
  • 量子アニーリングの実行時間は問題サイズに関係なく一定(約2000 μs)を維持したが、古典的手法は入力サイズに比例して増加し(35,000–50,000 μs)、差が明確に現れた。
  • PCCが最も優れた結果をもたらしたが、MICやGMICといった他の指標も特定のデータセットでは同等の性能を示し、より広範な適用可能性が示唆された。
  • 本手法は入力次元を効果的に低減しながらも、モデル性能を向上させることに成功し、実世界の回帰タスクにおける量子支援特徴選択の可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。