Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end symbolic regression with transformers

Pierre-Alexandre Kamienny, Stéphane d’Ascoli|arXiv (Cornell University)|Apr 22, 2022
Evolutionary Algorithms and Applications被引用数 9
ひとこと要約

本稿では、混合記号的・数値的語彙を用いて、数値定数を含む完全な数式を直接予測する、トランスフォーマーを用いたエンドツーエンドの記号的回帰手法を提案する。この手法は、SRBenchベンチマークで最先端の精度を達成しており、遺伝的プログラミング(GP)に近い性能に到達する一方で、推論速度が1000倍以上速く、低ノイズおよび外挿設定において特に効果的である。BFGSによる精練により性能が向上する。

ABSTRACT

Symbolic regression, the task of predicting the mathematical expression of a function from the observation of its values, is a difficult task which usually involves a two-step procedure: predicting the "skeleton" of the expression up to the choice of numerical constants, then fitting the constants by optimizing a non-convex loss function. The dominant approach is genetic programming, which evolves candidates by iterating this subroutine a large number of times. Neural networks have recently been tasked to predict the correct skeleton in a single try, but remain much less powerful. In this paper, we challenge this two-step procedure, and task a Transformer to directly predict the full mathematical expression, constants included. One can subsequently refine the predicted constants by feeding them to the non-convex optimizer as an informed initialization. We present ablations to show that this end-to-end approach yields better results, sometimes even without the refinement step. We evaluate our model on problems from the SRBench benchmark and show that our model approaches the performance of state-of-the-art genetic programming with several orders of magnitude faster inference.

研究の動機と目的

  • 2段階の記号的回帰の限界を克服すること。具体的には、スケルトン予測と定数フィッティングが分離されており、誤差が蓄積されやすい点を改善する。
  • 深層学習を用いて、数値定数を含む完全な数式を直接、エンドツーエンドで予測可能にする。
  • 高い精度を維持しつつ、最先端の遺伝的プログラミング(GP)手法と比較して、推論速度と頑健性を向上させる。
  • 10個の入力特徴量までスケーラブルであることを示し、従来の深層学習ベースのSRモデルがD ≤ 3に限定されていたのに対し、拡張性を示す。
  • ノイズや外挿に対する頑健性を評価し、モデル予測による情報付き初期化が非凸最適化の失敗を低減することを示す。

提案手法

  • 本モデルは、演算子、変数、数値定数のトークンを含む混合記号的・数値的語彙を採用し、数式のエンドツーエンドのシーケンス生成を可能にする。
  • 合成データセット上で訓練されたトランスフォーマー基盤のアーキテクチャを用い、スケルトン予測を回避して、入力-出力ペアから直接完全な数式を予測する。
  • 予測後、予測された定数を情報付き初期値として用いてBFGS最適化を実行し、収束性と精度を向上させる。
  • 従来のモデルがD≤3に限定されていたのに対し、高次元問題(最大D=10)へのスケーリングを可能にする特別なトークン化および生成技術を採用する。
  • 訓練データは、事前に定義された数式の文法からサンプリングすることで合成され、多様で現実的である訓練例を保証する。
  • 推論は、トランスフォーマーの単一の順伝播と、その後の単一のBFGSコールにより高速化され、リアルタイムデプロイメントが可能になる。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー・モデルは、中間のスケルトン予測を経由せずに、数値定数を含む完全な数式を直接予測可能であり、競争力のある性能を達成できるか?
  • RQ2定数推定を統合したエンドツーエンド予測は、2段階のスケルトンベース手法と比較して、精度と頑健性を向上させるか?
  • RQ3予測された定数は、非凸な最適化領域においてBFGSの初期値として効果的であるか?
  • RQ4推論速度、精度、多様な記号的回帰問題(ノイズあり、分布外設定を含む)における一般化性能の観点から、本手法はどのように性能を示すか?
  • RQ5従来の深層学習ベースのSR手法がD ≤ 3に限定されていたのに対し、本モデルはD > 3の高次元問題への一般化能力はどの程度高いか?

主な発見

  • エンドツーエンドモデルは、SRBenchベンチマークで遺伝的プログラミング(例:Operon)に匹敵する精度(誤差2%以内)を達成しており、GPベース手法と比較して推論が最大1000倍速い。
  • Feynman問題では平均精度(R² > 0.99)で4位にランクインしたが、トップパフォーマンスのGPモデルと比較して、生成された数式の複雑さが著しく低い。
  • BFGSによる精錬を施した結果、ラベルノイズに対して高い頑健性を示し、高ノイズ条件下でもスケルトンのみのモデルを上回った。
  • 外挿に対して優れた一般化性能を示し、学習分布をはるかに超えるテスト入力スケール(σ = 32)でも、妥当な性能を維持した。
  • 10個の入力特徴量までスケーラブルであることを実証し、従来の深層学習ベースSRモデルがD ≤ 3に限定されていたのに対し、顕著な改善を示した。
  • アブレーション実験により、定数予測を統合したエンドツーエンド学習は、精錬なしでもスケルトンベース手法を上回る結果をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。