[論文レビュー] SymFormer: End-to-end symbolic regression using transformer-based architecture
SymFormer は、1回の順方向伝搬で記号的式と数値定数を同時に予測するエンド・ツー・エンドの変換器ベースのアーキテクチャを提案する。これにより、従来の手法に比べて適合精度と推論速度が著しく向上した。勾配ベースの微調整と学習された定数を統合することで、ベンチマークデータセット上で R² = 1.0000、相対誤差 = 0.0010 の最先端の性能を達成した。
Many real-world problems can be naturally described by mathematical formulas. The task of finding formulas from a set of observed inputs and outputs is called symbolic regression. Recently, neural networks have been applied to symbolic regression, among which the transformer-based ones seem to be the most promising. After training the transformer on a large number of formulas (in the order of days), the actual inference, i.e., finding a formula for new, unseen data, is very fast (in the order of seconds). This is considerably faster than state-of-the-art evolutionary methods. The main drawback of transformers is that they generate formulas without numerical constants, which have to be optimized separately, so yielding suboptimal results. We propose a transformer-based approach called SymFormer, which predicts the formula by outputting the individual symbols and the corresponding constants simultaneously. This leads to better performance in terms of fitting the available data. In addition, the constants provided by SymFormer serve as a good starting point for subsequent tuning via gradient descent to further improve the performance. We show on a set of benchmarks that SymFormer outperforms two state-of-the-art methods while having faster inference.
研究の動機と目的
- 記号的回帰モデルが数値定数を含まない式を生成するという既存手法の制限を解消する。
- 推論中に記号的式と具体的な定数値を同時に学習する変換器を訓練することで、記号的回帰の性能を向上させる。
- 予測された定数を局所的勾配降下最適化の初期化に使用することで、モデルの汎化性能と適合精度を向上させる。
- 注意機構と系列モデリングの向上を図るための、定数の新たな符号化戦略の有効性を検証する。
- 実世界の科学的・工学的応用に適した、高速で正確かつ汎化可能な記号的回帰を実現する。
提案手法
- 数百億の記号的式からなる大規模データセット上で、エンド・ツー・エンドに訓練された変換器ベースのアーキテクチャを採用する。
- 修飾されたトークン語彙を用いて、記号的トークン(例:'+', 'sin', 'x')と数値定数を、1つの自己回帰的系列で同時に生成する。
- 定数のための新しい「拡張符号化」戦略を採用し、対数および指数変換(例:'a^x' を 'exp(x * ln(a))' として表現)を用いることで、数値的安定性と定数値に対するモデルの注目度を向上させる。
- 予測された定数を、BFGS や勾配降下法による局所的最適化の初期化点として使用し、観測データ上の平均二乗誤差を最小化するように最終的な式を精緻化する。
- 注意機構を活用して、以前に予測された定数に条件づけられた記号的生成を実現し、より一貫性があり正確な式構築を可能にする。
- 2段階の推論パイプラインを採用する:まず、定数を含む候補式を生成する。次に、観測データ上で平均二乗誤差を最小化するように勾配ベースの最適化により定数をさらに調整する。
実験結果
リサーチクエスチョン
- RQ1推論時に記号的式と数値定数を同時に予測することで、定数を別個に予測するモデルに比べ、記号的回帰の精度が向上するか?
- RQ2定数に対数および指数変換を適用することで、記号的生成におけるモデル性能と数値的安定性が向上するか?
- RQ3予測された定数を初期化点として勾配ベースの微調整を統合することで、最終的なモデル精度と収束速度にどのような影響を与えるか?
- RQ4提案された拡張符号化戦略は、標準的な定数表現に比べて、記号的変換器における注目度と系列モデリングにどの程度向上をもたらすか?
- RQ5特にベンチマークデータセット上での R² と相対誤差の観点から、SymFormer は最先端の記号的回帰手法に比べて性能と推論速度で優れているか?
主な発見
- Top-K サンプリング(K=20、256 サンプル)を用いたベンチマークデータセット上での SymFormer は、R² = 1.0000、相対誤差 = 0.0010 を達成し、従来手法を著しく上回った。
- アブレーションスタディの結果、トレーニング時に定数を予測することで性能が向上することが確認された。定数予測を含むベース符号化(R² = 0.9979、誤差 = 0.0669)は、定数を含まないモデル(R² = 0.9929、誤差 = 0.1547)を上回った。
- 勾配ベースの微調整を組み合わせた拡張符号化戦略が最良の結果(R² = 1.0000、誤差 = 0.0010)を達成し、適切な定数表現がモデルの汎化性能と注目度の向上に寄与することを示した。
- SymFormer の推論速度は、進化的手法に比べて著しく速く、推論時間は数秒のオーダーであり、リアルタイム応用に適している。
- モデルは強力な外挿能力を示し、訓練入力範囲をはるかに超えて良好に一般化することが、分布外テストにより検証された。
- 定性的な分析から、SymFormer はデータから複雑な数学的関係(例:フーリエ型分解)を回復できることを示し、多様な式で事前学習したことで強い誘導バイアスを有していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。