Skip to main content
QUICK REVIEW

[論文レビュー] Logic Guided Genetic Algorithms

Dhananjay Ashok, Joseph Scott|arXiv (Cornell University)|Oct 21, 2020
Evolutionary Algorithms and Applications参考文献 20被引用数 6
ひとこと要約

本稿では、分野特有の補助的真実(ATs)を遺伝的アルゴリズムにおける損失計算およびデータ拡張に統合することで、記号的回帰(SR)を向上させるロジックガイドド遺伝的アルゴリズム(LGGA)を提案する。違反されたATsから反例データポイントを繰り返し生成することで、LGGAはデータ効率性と精度を向上させ、Eureqa や TuringBot といったSRツールが『ファインマン物理学講義』に掲載された物理方程式について最大30.0%多くの方程式を解けるようになり、データ効率性は最大61.9%向上した。

ABSTRACT

We present a novel Auxiliary Truth enhanced Genetic Algorithm (GA) that uses logical or mathematical constraints as a means of data augmentation as well as to compute loss (in conjunction with the traditional MSE), with the aim of increasing both data efficiency and accuracy of symbolic regression (SR) algorithms. Our method, logic-guided genetic algorithm (LGGA), takes as input a set of labelled data points and auxiliary truths (ATs) (mathematical facts known a priori about the unknown function the regressor aims to learn) and outputs a specially generated and curated dataset that can be used with any SR method. Three key insights underpin our method: first, SR users often know simple ATs about the function they are trying to learn. Second, whenever an SR system produces a candidate equation inconsistent with these ATs, we can compute a counterexample to prove the inconsistency, and further, this counterexample may be used to augment the dataset and fed back to the SR system in a corrective feedback loop. Third, the value addition of these ATs is that their use in both the loss function and the data augmentation process leads to better rates of convergence, accuracy, and data efficiency. We evaluate LGGA against state-of-the-art SR tools, namely, Eureqa and TuringBot on 16 physics equations from "The Feynman Lectures on Physics" book. We find that using these SR tools in conjunction with LGGA results in them solving up to 30.0% more equations, needing only a fraction of the amount of data compared to the same tool without LGGA, i.e., resulting in up to a 61.9% improvement in data efficiency.

研究の動機と目的

  • 事前に分かっている分野特有の補助的真実(ATs)を組み込むことで、記号的回帰(SR)におけるデータ効率性と精度を向上させること。
  • 違反されたATsを用いて、データセットのキュレーションに役立つ情報豊富な反例データポイントを生成するフィードバックループを構築すること。
  • ATsから導かれる論理的制約と従来の平均二乗誤差(MSE)損失を組み合わせることで、従来の遺伝的アルゴリズム(GAs)を強化すること。
  • ターゲット関数の数学的性質を活用することで、大規模なトレーニングデータセットへの依存を減らすこと。
  • 『ファインマン物理学講義』に掲載された実世界の物理方程式を対象に本手法を評価し、SRパフォーマンスにおける実用的利点を示すこと。

提案手法

  • LGGAはラベル付きデータポイントと補助的真実(ATs)——対称性、ゼロ条件、関数的恒等式などの数学的事実——を入力として受ける。
  • 遺伝的アルゴリズムを用いて候補となる記号的式を進化させ、既存のデータポイントにおける式評価によりATsとの整合性を確認する。
  • 候補式がATを違反した場合、違反したATを用いて既存の入力を変換することで反例データポイントを生成する。
  • これらの新しいデータポイントはトレーニングセットに追加され、モデルの収束性と精度を向上させるフィードバックループが形成される。
  • 従来のMSE損失に加え、ATsから導かれる制約に基づく損失を組み合わせることで、数学的に妥当で正確な式への探索をガイドする。
  • プロセスは反復的である:候補式がいずれのATをも違反しない限り、新しいデータは生成されない。これにより、的を射たかつ効率的なデータ拡張が保証される。

実験結果

リサーチクエスチョン

  • RQ1記号的回帰に補助的真実(ATs)を統合することで、データ効率性と収束速度が向上するか。
  • RQ2違反されたATsに基づくオンラインでフィードバックを受けるデータ拡張戦略は、静的データ生成戦略に比べてどれほど効果的か。
  • RQ3Eureqa や TuringBot といった既存のSRツールのパフォーマンスをLGGAはどの程度向上できるか。
  • RQ4ATベースの損失とデータ拡張を組み合わせることで、記号的回帰における精度と頑健性が向上するか。
  • RQ5オラクルやSMTソルバーを用いた手法と比較して、LGGAはスケーラビリティと実用性においてどう異なるか。

主な発見

  • LGGAを用いることで、Eureqa や TuringBot は『ファインマン物理学講義』に掲載された方程式のうち、ベースラインのSRに比べ最大30.0%多くの方程式を解けるようになった。
  • 本手法は最大61.9%のデータ効率性向上を達成し、類似またはより高いパフォーマンスに到達するためのトレーニングデータポイントの数を顕著に削減した。
  • LGGAが生成したデータセットは、ATsから手動で生成されたデータよりも優れており、高価値の反例を効果的に選択するオンラインフィードバックループの有効性を示している。
  • ATベースの損失と動的データ拡張の組み合わせにより、記号的回帰タスクにおける収束速度の向上と精度の向上が達成された。
  • 単純な遺伝的アルゴリズムでも本手法は有効であるため、TuringBot や Eureqa といった高度なSRツールと統合すればさらなる向上が期待できる。
  • LGGAは反例生成にオラクルやSMTソルバーへのアクセスを必要としないため、実世界の応用において実用的でスケーラブルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。