[論文レビュー] Correlation versus RMSE Loss Functions in Symbolic Regression Tasks
本論文では、従来のRMSEの代わりにピアソン積率相関係数(R²)を記号回帰における適応度関数として使用することを提案する。進化中にR²を最大化し、その後に線形補正処理を施すことで、特にノイズが多い、あるいは複雑なベンチマーク(フェインマンデータセットを含む)において、RMSEよりも収束が速く、精度が高く、必要な学習データ点数も少ないという成果が得られた。
The use of correlation as a fitness function is explored in symbolic regression tasks and the performance is compared against the typical RMSE fitness function. Using correlation with an alignment step to conclude the evolution led to significant performance gains over RMSE as a fitness function. Using correlation as a fitness function led to solutions being found in fewer generations compared to RMSE, as well it was found that fewer data points were needed in the training set to discover the correct equations. The Feynman Symbolic Regression Benchmark as well as several other old and recent GP benchmark problems were used to evaluate performance.
研究の動機と目的
- RMSEを相関に置き換えた適応度関数が、遺伝的プログラミングにおける記号回帰の性能を向上させるかどうかを調査すること。
- 相関に基づく適応度が、多様な記号回帰ベンチマークにおいて収束速度と解の精度に与える影響を評価すること。
- ノイズやデータ点数の変動に対して、相関に基づく適応度のロバストネスを評価すること。
- 相関を主な適応度指標として用いた場合に、後続処理としての線形補正がモデル品質をどの程度向上させるかを特定すること。
提案手法
- 遺伝的プログラミング記号回帰における標準的なRMSE適応度関数を、決定係数R²に置き換える。
- 進化中にR²を最大化することで、予測値とターゲット値の間の線形関係の強さを強調し、スケールに依存しない。
- 進化で得られたモデルの出力を真のターゲット値に一致させるために、後続処理として線形回帰を実行し、絶対誤差を最小化する:$\operatorname*{argmin}_{a_0,a_1} \sum_{i=1}^{N} |y_i - (a_1\hat{y}_i + a_0)|$。
- フェインマン記号回帰ベンチマークおよび他の既存のGPベンチマークを用いて、ノイズレベルやデータ点数の変動に応じた性能を評価する。
- 98のベンチマーク問題において、相関に基づく適応度関数とRMSEに基づく適応度関数の結果を比較する。
- 収束速度(解に到達する世代数)、解の精度(RMSE)、正確な式の発見成功率の観点から性能を測定する。
実験結果
リサーチクエスチョン
- RQ1相関を適応度関数として用いることで、RMSEよりも記号回帰における収束が速くなるか?
- RQ2相関に基づく適応度は、RMSEよりも少ない学習データ点数で正しい記号的式を発見できるか?
- RQ3ノイズがある条件下で、相関に基づく適応度はRMSEよりも優れた性能を示すか?
- RQ4後続処理としての線形補正は、相関に基づく適応度で進化させたモデルの品質をどの程度向上させるか?
- RQ5相関に基づく適応度の性能優位性は、複雑でノイズの多い問題を含む多様な記号回帰問題においても持続するか?
主な発見
- 相関に基づく適応度関数は顕著な性能向上を達成し、46のベンチマーク問題を完璧に解消した。そのうち29問はRMSEアプローチでは完璧に解けなかった。
- 200件のデータ点と10%のノイズ条件下で、相関法は98件のテストケースのうち79件でRMSEを上回った。
- 非自明なノイズを含む問題(式24~26)において、相関適応度関数はRMSEよりも一貫して速く、安定した収束を示した。
- 相関法は正しい式を発見するために必要なデータ点数を減らすことができ、データ効率性に優れたことが示された。
- 定数を式に組み込んだ場合、RMSE適応度関数はその大きさに著しく敏感になったが、相関法は依然としてロバストであった。
- 高い定数(例:50)でさえも、相関法は強い性能を維持した一方、RMSEの性能は急激に低下し、特にノイズがない状況で顕著だった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。