Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Symbolic Regression Datasets and Benchmarks for Scientific Discovery

Yoshitomo Matsubara, Naoya Chiba|arXiv (Cornell University)|2022. 06. 21.
Evolutionary Algorithms and Applications인용 수 7
한 줄 요약

이 논문은 물리학 강의록의 공식들에서 유래한 실제적인 변수 범위를 갖는 120개의 현실적인 데이터셋을 포함하는 신규 기준 테스트 세트를 소개하며, 방정식 유사도 평가를 위한 보다 우수한 지표로 정규화된 편집 거리(NED)를 제안한다. 실험 결과, 기존의 기호 회귀 방법들이 이 새로운 기준 테스트 세트에서는 이전 데이터셋보다 훨씬 열 劣한 성능을 보이며, 더 견고한 SRSD 방법의 필요성을 부각시킨다.

ABSTRACT

This paper revisits datasets and evaluation criteria for Symbolic Regression (SR), specifically focused on its potential for scientific discovery. Focused on a set of formulas used in the existing datasets based on Feynman Lectures on Physics, we recreate 120 datasets to discuss the performance of symbolic regression for scientific discovery (SRSD). For each of the 120 SRSD datasets, we carefully review the properties of the formula and its variables to design reasonably realistic sampling ranges of values so that our new SRSD datasets can be used for evaluating the potential of SRSD such as whether or not an SR method can (re)discover physical laws from such datasets. We also create another 120 datasets that contain dummy variables to examine whether SR methods can choose necessary variables only. Besides, we propose to use normalized edit distances (NED) between a predicted equation and the true equation trees for addressing a critical issue that existing SR metrics are either binary or errors between the target values and an SR model's predicted values for a given input. We conduct benchmark experiments on our new SRSD datasets using various representative SR methods. The experimental results show that we provide a more realistic performance evaluation, and our user study shows that the NED correlates with human judges significantly more than an existing SR metric. We publish repositories of our code and 240 SRSD datasets.

연구 동기 및 목표

  • 과학적 발견을 위한 현실적이고 물리적으로 기반을 둔 기호 회귀 데이터셋의 부족을 해결하기 위해.
  • 기하학적으로 다르지만 수치적으로 유사한 방정식을 동일하게 평가하는 기존 평가 지표의 한계를 극복하기 위해.
  • 실제 과학적 발견 과제를 더 잘 반영하기 위해 변수 범위의 현실성과 노이즈에 대한 저항력 등을 포함한 기준 테스트 세트를 만들기 위해.
  • 최신 기호 회귀 방법들이 더 도전적인 현실적인 데이터셋과 지표에서 성능을 평가하기 위해.
  • 미래의 SRSD 연구를 위해 재현 가능한 기준 테스트 세트를 제공하기 위해 (코드 및 데이터셋 포함)

제안 방법

  • 피너만의 물리학 강의록에 있는 공식들에서 120개의 기호 회귀 데이터셋을 재구성하였으며, 공식의 성질에 기반해 물리적으로 타당한 변수 범위를 정밀하게 정의하였다.
  • 기호 회귀 방법의 변수 선택 능력을 시험하기 위해 가짜 변수를 포함한 2세트의 120개 데이터셋을 설계하였다.
  • 예측된 방정식과 진짜 방정식 간의 구조적 유사도를 평가하기 위한 정량적 지표로 방정식 트리 간의 정규화된 편집 거리(NED)를 제안하였다.
  • 기호 표현의 일관된 파싱과 비교를 보장하기 위해 sympy를 사용해 트리 기반의 편집 거리를 계산하였다.
  • 목표 변수에 여러 수준의 가우시안 노이즈를 주입하여(γ ∈ {0, 10⁻³, 10⁻², 10⁻¹}) 실제 노이즈 조건에서의 저항력을 평가하였다.
  • 새로운 데이터셋과 NED 지표를 사용해 여섯 가지 SR 기준 모델에 대한 기준 테스트 실험을 수행하였다.

실험 결과

연구 질문

  • RQ1기존 기호 회귀 방법들은 인위적으로 제한된 변수 범위가 아닌 현실적인 변수 범위를 갖는 데이터셋에서 물리 법칙을 성공적으로 복원할 수 있는가?
  • RQ2제안된 정규화된 편집 거리(NED)는 기존 지표들과 비교해 인간의 방정식 유사도 판단과 얼마나 잘 상관되는가?
  • RQ3실제 물리적 변수 범위와 노이즈를 고려할 경우 기호 회귀 방법들이 얼마나 자주 정확한 방정식을 발견하지 못하는가?
  • RQ4가짜 변수를 포함한 데이터셋이 기법의 변수 선택 능력을 효과적으로 시험하는 데 기여하는가?
  • RQ5새로운 SRSD 기준 테스트 세트와 이전의 FSRD 기준 테스트 세트 간에 해답률과 NED 점수는 어떻게 비교되는가?

주요 결과

  • 새로운 SRSD 기준 테스트 세트에서 기존의 FSRD 기준 테스트 세트에 비해 해답률이 크게 떨어지며, 최고의 방법도 해답률이 52.65%에서 9.17%로 감소하였다.
  • 정규화된 편집 거리(NED)는 이전 기준 테스트에서 사용된 표준 해답률 지표보다 인간의 판단과 더 유의미하게 상관된다.
  • 노이즈 주입은 모든 방법에서 NED 점수를 증가시켜, 새로운 기준 테스트가 측정 오류와 같은 실제 세계의 과제를 잘 반영하고 있음을 확인시켰다.
  • 새로운 기준 테스트에서 방법 간 성능 격차가 더 두드러지며, 현재의 기호 회귀 방법들이 현실적인 과학적 발견 과제에서 어려움을 겪고 있음을 시사한다.
  • 이중 해답률이나 예측 오차만으로 평가하는 것보다, 제안된 NED 지표가 기호 회귀 성능 평가에 더 세밀하고 유의미한 정보를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.