Skip to main content
QUICK REVIEW

[논문 리뷰] Exhaustive Symbolic Regression

Deaglan J. Bartlett, Harry Desmond|arXiv (Cornell University)|2022. 11. 21.
Evolutionary Algorithms and Applications인용 수 9
한 줄 요약

이 논문은 최대 복잡도까지 정의된 연산자 집합을 사용해 모든 가능한 기호적 표현을 체계적으로 평가하는 결정론적 방법인 완전 기호 회귀(ESR)를 소개한다. 이는 최적의 함수를 보장한다. 정확도와 단순성의 통합 목적 함수로 최소 기술 길이 원칙을 적용함으로써 주관적인 모델 선택을 제거하고, 허블 상수와 초신성 데이터에 더 경제적으로 맞는 40개 이상의 함수를 발견한다. 이는 표준 천체역학 모델의 유일성을 도전한다.

ABSTRACT

Symbolic Regression (SR) algorithms attempt to learn analytic expressions which fit data accurately and in a highly interpretable manner. Conventional SR suffers from two fundamental issues which we address here. First, these methods search the space stochastically (typically using genetic programming) and hence do not necessarily find the best function. Second, the criteria used to select the equation optimally balancing accuracy with simplicity have been variable and subjective. To address these issues we introduce Exhaustive Symbolic Regression (ESR), which systematically and efficiently considers all possible equations -- made with a given basis set of operators and up to a specified maximum complexity -- and is therefore guaranteed to find the true optimum (if parameters are perfectly optimised) and a complete function ranking subject to these constraints. We implement the minimum description length principle as a rigorous method for combining these preferences into a single objective. To illustrate the power of ESR we apply it to a catalogue of cosmic chronometers and the Pantheon+ sample of supernovae to learn the Hubble rate as a function of redshift, finding $\sim$40 functions (out of 5.2 million trial functions) that fit the data more economically than the Friedmann equation. These low-redshift data therefore do not uniquely prefer the expansion history of the standard model of cosmology. We make our code and full equation sets publicly available.

연구 동기 및 목표

  • 기본 기호 회귀(SR)의 확률적 성격으로 인해 랜덤 검색으로 인해 최적의 함수를 놓칠 수 있는 문제를 해결하기 위해.
  • 정확도와 단순성을 조합하는 데 있어 주관적이고 일관되지 않은 SR의 모델 선택 기준을 해결하기 위해.
  • 주어진 복잡도까지 가능한 모든 기호적 표현에 대해 결정론적이고 완전한 탐색을 수행하여 진정한 파레토 최적 해를 보장하기 위해.
  • 최소 기술 길이(MDL) 원칙을 적용하여 파레토 최적 해를 단일 최적 모델 순위로 압축하기 위해.
  • 우주론적 데이터로부터 적색편이 함수에 대한 허블 상수의 대체 기능 형태를 발견함으로써 이 방법의 능력을 입증하기 위해.

제안 방법

  • ESR는 사전 정의된 연산자 집합(예: +, *, sqrt, exp)으로 구성된 모든 가능한 기호적 표현을 지정된 최대 트리 복잡도(노드 수)까지 체계적으로 열거한다.
  • 트리 구조 제약 조건과 대수적 간소화를 사용하여 중복되거나 동일한 함수를 제거함으로써, 난이도 있는 열거 방식 대비 약 1400배의 검색 공간을 축소한다.
  • 유일한 함수 각각에 대해 모든 자유 매개변수의 완전한 수치 최적화를 수행하여 데이터에 대한 최상의 맞춤을 달성한다.
  • 최소 기술 길이(MDL) 원칙을 적용하여 모델 적합도(로그우도)와 모델 복잡도(매개변수 및 구조적 복잡도)를 균형 잡는 단일 목적 점수를 계산한다.
  • MDL 점수는 음의 로그우도와 피셔 정보 행렬 기반의 페널티 항 및 매개변수 수를 합산하여 유도되며, 모든 후보 함수에 대한 일차원 순위를 가능하게 한다.
  • 이 방법은 오픈소스 코드로 구현되었으며, 두 가지 천체역학 데이터셋에 적용되었다: 우주 시계와 Pantheon+ 초신성 샘플.

실험 결과

연구 질문

  • RQ1기호적 표현에 대한 결정론적이고 완전한 탐색이 주어진 데이터셋과 복잡도 한계에서 전역적으로 최적의 함수를 보장할 수 있는가?
  • RQ2최소 기술 길이 원칙이 기존 히우리스틱 기준보다 정확도와 단순성을 더 엄격하고 객관적으로 통합하는 데 더 효과적인가?
  • RQ3저적색편이 천체역학 데이터에 대해 프리드리먼 방정식보다 더 경제적으로 맞는 허블 상수의 대체 기능 형태가 존재하는가?
  • RQ4현재의 천체역학 데이터가 표준 모델의 팽창 역사에 대해 얼마나 유일하게 지지를 하는가?
  • RQ5ESR을 사용해 기존 모델보다 데이터 피팅 성능이 뛰어나면서도 물리적 해석이 가능한 분석적 표현을 발견할 수 있는가?

주요 결과

  • ESR는 520만 개의 후보 식 중 40개의 함수를 식별하여, MDL 기준에 따라 우주 시계와 Pantheon+ 초신성 데이터에 프리드리먼 방정식보다 더 경제적으로 맞춘다.
  • 이 방법은 정확도와 복잡도 사이의 진정한 파레토 최적 해를 보장하여, 확률적 탐색으로 인한 최적 해 유실 위험을 제거한다.
  • 최소 기술 길이 원칙을 적용함으로써 ESR은 모든 후보 함수에 대해 단일 객관적 순위를 제공하여 파레토 최적 해에서의 선택 불확실성을 해결한다.
  • 코드와 생성된 식의 전체 세트는 https://github.com/DeaglanBartlett/ESR 에 공개되어 재현성과 재사용을 가능하게 한다.
  • 결과는 저적색편이 천체역학 데이터가 표준 모델의 팽창 역사에 대해 특별히 유일하게 지지를 하지 않음을 시사하며, MDL 기준 하에서 여러 대체 분석 형태가 동일하거나 더 우수한 성능을 보인다.
  • ESR 프레임워크는 일반화 가능하며, 동반 논문에서 은하 역학의 반경 방향 가속도 관계의 기능 형태를 발견하는 데도 이미 적용되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.