Skip to main content
QUICK REVIEW

[論文レビュー] Learning concise representations for regression by evolving networks of trees

William La Cava, Tilak Raj Singh|arXiv (Cornell University)|Jul 3, 2018
Evolutionary Algorithms and Applications被引用数 15
ひとこと要約

本稿では、回帰のための簡潔で解釈可能な表現を学習するため、表現木のネットワークを進化させるFEATという手法を提案する。勾配降下法による微分可能特徴学習と、モデル重みによって誘導される進化的計算を組み合わせることで、100の回帰問題において最先端のテスト性能を達成するとともに、勾配ブースティングなどの競合手法と比べてモデルサイズが桁違いに小さい。

ABSTRACT

We propose and study a method for learning interpretable representations for the task of regression. Features are represented as networks of multi-type expression trees comprised of activation functions common in neural networks in addition to other elementary functions. Differentiable features are trained via gradient descent, and the performance of features in a linear model is used to weight the rate of change among subcomponents of each representation. The search process maintains an archive of representations with accuracy-complexity trade-offs to assist in generalization and interpretation. We compare several stochastic optimization approaches within this framework. We benchmark these variants on 100 open-source regression problems in comparison to state-of-the-art machine learning approaches. Our main finding is that this approach produces the highest average test scores across problems while producing representations that are orders of magnitude smaller than the next best performing method (gradient boosting). We also report a negative result in which attempts to directly optimize the disentanglement of the representation result in more highly correlated features.

研究の動機と目的

  • 一般化性能に優れる、解釈可能で低複雑性の回帰表現を学習する手法を開発すること。
  • 進化的計算が、モジュラーで分離可能な表現を生成できることを検証すること。
  • さまざまな確率的最適化戦略が、簡潔で正確な表現を学習する際の性能をベンチマークすること。
  • 特徴の分離を明示的に最適化することで、モデルの解釈性と一般化性能が向上するかを調査すること。
  • 自動特徴工学におけるモデルの精度と表現の複雑さのトレードオフを評価すること。

提案手法

  • FEATは、多様なタイプの表現木のネットワークとして特徴を表現し、ニューラルネットワークの活性化関数と基本的な数学的演算を組み合わせる。
  • 各表現は勾配降下法を用いて微分可能特徴を最適化するが、線形モデルの重みを用いて進化的プロセスにおける変異を誘導する。
  • アルゴリズムは、精度と複雑さのバランスを取った表現のアーカイブを維持し、一般化性能と解釈可能性を実現する。
  • 進化的計算によりアーキテクチャ空間を探索し、モデル重みからのフィードバックに基づいて構文木に変異演算子を適用する。
  • 複数の確率的最適化アプローチ(進化的および非進化的な手法を含む)を、多目的基準を用いて比較する。
  • モデル選択は、進化した特徴に基づいてフィッティングされた線形モデルを用い、特徴の重要性は学習された係数の絶対値によって決定する。

実験結果

リサーチクエスチョン

  • RQ1表現木のネットワークを進化させることで、最先端の手法よりも顕著に簡潔で、かつ高い精度を持つ回帰モデルを生成できるか?
  • RQ2進化的プロセスにおいてモデル重みをフィードバックとして用いることで、学習された表現の品質が向上するか?
  • RQ3特徴の分離や低相関を明示的に最適化することで、より良い解釈性と一般化性能が得られるか?
  • RQ4さまざまな確率的最適化戦略は、回帰のためのコンパクトで正確な表現を学習する際に、どのように比較されるか?
  • RQ5モデル選択プロセスは、多重共線性がペナルティとして課されたとしても、高相関特徴を好む傾向があるか、その程度はどの程度か?

主な発見

  • FEATは、100のオープンソース回帰問題において、XGBoost、ランダムフォレスト、ElasticNetを含む最先端の手法を上回る平均テストR²スコアを達成した。
  • FEATが生成した最終モデルは、勾配ブースティングのものと比べて桁違いに小さく、中央値のモデルサイズは12ノードであったのに対し、XGBoostでは1,000ノードを超えていた。
  • 最適化中に特徴相関を明示的に最小化した(FeatCorrおよびFeatCNを用いて)が、最終的な表現における相関は低下せず、場合によっては増加した。これは、このような目的関数が分離性の向上に寄与するという仮説に反する結果であった。
  • FEATの最終的に選択されたモデルは、非線形的・多項式的・相互作用を含む特徴(例:tanh(x₁)、x₁·x₀·(x₃−x₀))を組み合わせており、単純な表現からより正確な表現へと複雑さが段階的に増加する傾向が示された。
  • FEATとMLPは高い相関を持つ特徴空間を生成したが、FEATの表現はMLPよりも多くの二変量相関を示しており、最適化の目的にもかかわらず、特徴の冗長性に傾向があることが示された。
  • モデル選択プロセスは、検証誤差と係数の絶対値に依存しており、多重共線性は標準誤差に影響するが、必ずしも予測性能に影響しないことから、高相関表現を間接的に好む可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。