[논문 리뷰] Contemporary Symbolic Regression Methods and their Relative Performance
논문은 SRBench를 제시하며, 14개의 기호 회귀(SR) 방법과 7개의 ML 방법을 252개의 회귀 문제에 걸쳐 비교하는 오픈 소스 벤치마크 플랫폼을 소개하고, GP 기반 SR 방법이 실세계 데이터에서 종종 다른 방법들보다 성능이 좋으며, 특정 방법들은 저잡음 조건에서 정확한 지상진리 방정식을 회복하는 데 뛰어나다고 주장한다.
Many promising approaches to symbolic regression have been presented in recent years, yet progress in the field continues to suffer from a lack of uniform, robust, and transparent benchmarking standards. We address this shortcoming by introducing an open-source, reproducible benchmarking platform for symbolic regression. We assess 14 symbolic regression methods and 7 machine learning methods on a set of 252 diverse regression problems. Our assessment includes both real-world datasets with no known model form as well as ground-truth benchmark problems. For the real-world datasets, we benchmark the ability of each method to learn models with low error and low complexity relative to state-of-the-art machine learning methods. For the synthetic problems, we assess each method's ability to find exact solutions in the presence of varying levels of noise. Under these controlled experiments, we conclude that the best performing methods for real-world regression combine genetic algorithms with parameter estimation and/or semantic search drivers. When tasked with recovering exact equations in the presence of noise, we find that several approaches perform similarly. We provide a detailed guide to reproducing this experiment and contributing new methods, and encourage other researchers to collaborate with us on a common and living symbolic regression benchmark.
연구 동기 및 목표
- 표준화되고 투명한 기호 회귀 벤치마킹을 촉진하여 공정한 비교와 재현성을 가능하게 한다.
- 다양한 실제 세계 및 합성 문제에서 현대 SR 방법의 광범위한 범위를 기존 ML 기준선과 함께 평가한다.
- 다양한 노이즈 수준에서 정확도-복잡도 트레이드오프와 알려진 ground-truth 방정식을 회복하는 능력을 특징화한다.
- 커뮤니티 기여를 독려하는 재현 가능한 워크플로우와 상시 업데이트되는 SR 벤치마크 저장소를 제공한다.
제안 방법
- SRBench를 SR를 위한 오픈 소스, 재현 가능한 벤치마킹 플랫폼으로 개발한다.
- Penn ML Benchmark (PMLB)를 130개의 SR 데이터셋으로 확장하고 방법들의 Python API를 표준화한다.
- 고정된 환경, CI, 재현 가능한 실험 설정으로 14개 SR 방법과 7개 ML 방법을 벤치마크한다.
- 블랙 박스 회귀 문제(알려지지 않은 그라운드 트루스)와 그라운드 트루스 문제(합성 물리/ODEs)에 대해 평가한다.
- 정확도(R2), 모델 복잡도, 기호 해법 회복에 대한 지표를 사용하며, sympy를 통한 단순화도 활용한다.
- 실험 재현 및 새로운 방법 추가를 위한 상세하고 커뮤니티 주도 프로토콜을 제공한다.
실험 결과
연구 질문
- RQ1실제 세계의 블랙-박스 회귀 문제에서 어떤 SR 방법이 정확도와 단순성의 균형을 가장 잘 달성하는가?
- RQ2노이즈가 있는 데이터에서 SR 방법이 ground-truth 기호 방정식을 회복할 수 있는가, 그리고 성능이 딥러닝 접근법과 어떻게 비교되는가?
- RQ3다양한 벤치마크에서 GP 기반 SR 방법이 비 GP 접근법(예: 그라디언트 부스팅, 신경망 모델)과 어떻게 비교되는가?
- RQ4노이즈가 ground-truth 문제에 대해 정확한 기호 해를 찾는 능력에 어떤 영향을 미치는가?
주요 결과
- Operon은 블랙 박스 문제에서 테스트 세트 R2 정확도가 가장 높으며, 다른 방법들을 크게 능가한다.
- SBP-GP와 FEAT가 정확도에서 상위권에 랭크되며, FEAT가 훨씬 더 작은 모델을 생성한다.
- 상위 SR 방법의 다수가 GP 기반이며, 그들은 단순성 및/또는 정확성에서 LightGBM과 XGBoost 같은 트리 앙상블 방법을 능가한다.
- 비 GP SR 방법 중 FFX와 DSR은 비슷하게 수행하며 BSR 및 AIFeynman보다 낫고, DSR은 가장 작은 해 중 일부를 생성한다.
- 노이즈가 적은 ground-truth 문제에서 AIFeynman이 가장 자주 정확한 해를 회복한다(53%), 그러나 노이즈가 더 높아지면 DSR, gplearn, AFP_FE, AFP가 더 잘 수행한다.
- 정확도와 단순성을 함께 고려할 때, Operon, GP-GOMEA, 및 DSR이 블랙 박스 문제 전반에 걸쳐 파레토 프런트를 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.