Skip to main content
QUICK REVIEW

[논문 리뷰] GSR: A Generalized Symbolic Regression Approach

Tony Tohme, Dehong Liu|arXiv (Cornell University)|2022. 05. 31.
Evolutionary Algorithms and Applications인용 수 5
한 줄 요약

이 논문은 일반화된 기호 회귀(GSR)를 소개하며, 기존 기호 회귀의 성능을 향상시키기 위해 목표 변수의 변환을 학습하고, 유전적 프로그래밍 프레임워크 내에서 기저 함수를 행렬 기반으로 인코딩하는 새로운 접근법을 제안한다. GSR는 표준 벤치마크에서 경쟁력 있는 성능을 기록하며, 더 도전적인 SR 벤치마크 세트인 SymSet을 도입한다.

ABSTRACT

Identifying the mathematical relationships that best describe a dataset remains a very challenging problem in machine learning, and is known as Symbolic Regression (SR). In contrast to neural networks which are often treated as black boxes, SR attempts to gain insight into the underlying relationships between the independent variables and the target variable of a given dataset by assembling analytical functions. In this paper, we present GSR, a Generalized Symbolic Regression approach, by modifying the conventional SR optimization problem formulation, while keeping the main SR objective intact. In GSR, we infer mathematical relationships between the independent variables and some transformation of the target variable. We constrain our search space to a weighted sum of basis functions, and propose a genetic programming approach with a matrix-based encoding scheme. We show that our GSR method is competitive with strong SR benchmark methods, achieving promising experimental performance on the well-known SR benchmark problem sets. Finally, we highlight the strengths of GSR by introducing SymSet, a new SR benchmark set which is more challenging relative to the existing benchmarks.

연구 동기 및 목표

  • 데이터셋 내에서 해석 가능한 수학적 관계를 기호 회귀를 통해 식별하는 데 도전 과제를 해결하기 위해.
  • 기존 기호 회귀를 향상시키기 위해 목표 변수의 변환을 학습함으로써 모델의 유연성과 정확도를 향상시키기 위해.
  • 기존 방법보다 벤치마크 데이터셋에서 승리할 수 있는 확장 가능하고 해석 가능한 방법을 개발하기 위해.
  • 기존 SR 벤치마크보다 더 도전적인 성능 평가를 가능하게 하기 위해, 새로운 더 어려운 기호 회귀 벤치마크 세트인 SymSet을 도입하기 위해.

제안 방법

  • GSR는 기존 기호 회귀 문제를 수정하여 목표 변수의 변환을 학습함으로써 더 유연하고 정확한 모델링을 가능하게 한다.
  • 이 방법은 복잡성을 줄이면서도 표현력을 유지하기 위해 기저 함수의 가중합으로서의 검색 공간을 제약한다.
  • 기저 함수를 표현하기 위해 행렬 기반 인코딩 체계를 사용하며, 각 행은 변환, 인자 유형, 활성 변수를 인코딩한다.
  • 인코딩은 매트릭스 요소를 수학적 연산자와 변수로 매핑하는 룩업 테이블을 사용하여 복잡한 표현의 체계적인 구축을 가능하게 한다.
  • 후보 해를 진화시키기 위해 유전적 프로그래밍을 활용하며, 적합도는 훈련 데이터에 대한 회귀 성능 기반으로 평가된다.
  • GSR는 $ n_{\bm{B}^\phi} $ 및 $ m_{\bm{B}^\phi} $와 같은 파라미터를 통해 기저 함수 복잡도를 동적으로 조정할 수 있으며, 이는 변환 수와 피연산자 수를 제어한다.

실험 결과

연구 질문

  • RQ1기존 접근법과 비교해 목표 변수의 변환을 학습하는 것이 기호 회귀 성능을 향상시키는가?
  • RQ2스케일러비리티와 검색 효율성 측면에서 트리 기반 또는 문자열 기반 인코딩과 비교해 행렬 기반 인코딩 체계는 어떻게 성능을 냈는가?
  • RQ3일반화된 기호 회귀 프레임워크는 다양한 벤치마크 문제에서 경쟁력 있는 정확도를 달성하면서도 해석 가능성을 유지할 수 있는가?
  • RQ4제안된 SymSet 벤치마크 세트는 기존 SR 벤치마크보다 얼마나 더 도전적인가?
  • RQ5기존 및 신규 도입된 벤치마크에서 GSR은 최신 기술 기반 기호 회귀 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • GSR는 잘 알려진 기호 회귀 벤치마크 문제 세트에서 경쟁력 있는 성능을 기록하며, 뛀난 일반화 능력과 정확도를 보였다.
  • SymSet의 도입은 기존 벤치마크보다 더 도전적인 벤치마크 세트를 제공하여 기호 회귀 방법의 성능 평가를 향상시켰다.
  • 행렬 기반 인코딩 체계는 복잡한 수학적 표현의 효율적이고 체계적인 표현을 가능하게 하여 검색 효율성을 향상시켰다.
  • GSR이 목표 변수의 변환을 학습할 수 있는 능력은 비선형 스케일링이 필요한 경우 더 잘 맞는 모델을 도출함으로써 성능 향상을 이끌었다.
  • 이 방법은 복잡한 비선형 관계와 고차원 입력을 포함한 다양한 문제 유형에서 뛰어난 강건성을 보였다.
  • 실험 결과는 GSR이 표준 벤치마크에서 강력한 기준 방법과 비교해 우수하거나 동등한 성능을 내며, 그 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.