Skip to main content
QUICK REVIEW

[논문 리뷰] SymFormer: End-to-end symbolic regression using transformer-based architecture

Martin Vastl, Jonáš Kulhánek|arXiv (Cornell University)|2022. 05. 31.
Evolutionary Algorithms and Applications인용 수 14
한 줄 요약

SymFormer는 심볼릭 회귀를 위한 엔드 투 엔드 트랜스포머 기반 아키텍처를 제안하며, 단일 프로퍼스에서 심볼릭 표현식과 수치적 상수를 동시에 예측함으로써 기존 방법에 비해 피팅 정확도와 추론 속도를 크게 향상시킵니다. 학습된 상수를 기반으로 한 기울기 기반 미세조정을 통합함으로써, 벤치마크 데이터셋에서 R² = 1.0000 및 상대 오차 0.0010을 달성하여 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

Many real-world problems can be naturally described by mathematical formulas. The task of finding formulas from a set of observed inputs and outputs is called symbolic regression. Recently, neural networks have been applied to symbolic regression, among which the transformer-based ones seem to be the most promising. After training the transformer on a large number of formulas (in the order of days), the actual inference, i.e., finding a formula for new, unseen data, is very fast (in the order of seconds). This is considerably faster than state-of-the-art evolutionary methods. The main drawback of transformers is that they generate formulas without numerical constants, which have to be optimized separately, so yielding suboptimal results. We propose a transformer-based approach called SymFormer, which predicts the formula by outputting the individual symbols and the corresponding constants simultaneously. This leads to better performance in terms of fitting the available data. In addition, the constants provided by SymFormer serve as a good starting point for subsequent tuning via gradient descent to further improve the performance. We show on a set of benchmarks that SymFormer outperforms two state-of-the-art methods while having faster inference.

연구 동기 및 목표

  • 기존 신경망 기반 심볼릭 회귀 모델이 수치적 상수 없이 수식을 생성함으로써 최적의 피팅이 이루어지지 않는 한계를 해결하기 위해.
  • 추론 중에 심볼릭 표현식과 구체적인 상수 값을 동시에 학습시킴으로써 심볼릭 회귀 성능을 향상시키기 위해.
  • 예측된 상수를 국소 기울기 강하 최적화의 초기화 값으로 사용하여 모델의 일반화 능력과 피팅 정확도를 향상시키기 위해.
  • 심볼릭 생성에서 주의 메커니즘과 시퀀스 모델링을 향상시키는 데 기여하는 새로운 상수 인코딩 전략의 효과를 검증하기 위해.
  • 실제 과학적 및 공학적 응용 분야에 적합한 빠르고 정확하며 일반화 능력이 뛰어난 심볼릭 회귀를 가능하게 하기 위해.

제안 방법

  • 수백만 개의 심볼릭 수식으로 구성된 대규모 데이터셋에서 엔드 투 엔드로 트랜스포머 기반 아키텍처를 훈련합니다.
  • 수정된 토큰 어휘를 사용하여 단일 순차적 생성 과정에서 심볼릭 토큰(예: '+', 'sin', 'x')과 수치적 상수를 동시에 생성합니다. 이 어휘에는 상수 자리표가 포함되어 있습니다.
  • 수치적 안정성 향상과 상수 값에 대한 주의 메커니즘 향상을 위해, 상수를 로그 및 지수 변환을 사용한 새로운 '확장 인코딩' 전략을 도입합니다(예: 'a^x'를 'exp(x * ln(a))'로 표현함).
  • 예측된 상수를 BFGS 또는 기울기 강하를 사용한 국소 최적화의 초기화 값으로 사용하여 관측된 데이터에서 평균 제곱오차를 최소화함으로써 최종 수식을 정밀하게 조정합니다.
  • 심볼릭 생성을 이전에 예측된 상수를 조건으로 하여 주의 메커니즘을 활용함으로써 더 일관되고 정확한 수식 생성을 가능하게 합니다.
  • 두 단계 추론 파이프라인을 사용합니다: 첫 번째 단계에서 모델은 상수를 포함한 후보 수식을 생성하고, 두 번째 단계에서 기울기 기반 최적화를 통해 상수를 추가로 조정하여 관측 데이터에서의 피팅 정확도를 향상시킵니다.

실험 결과

연구 질문

  • RQ1추론 중에 심볼릭 표현식과 수치적 상수를 동시에 예측하는 것이 별도로 상수를 예측하는 모델에 비해 심볼릭 회귀 정확도를 향상시키는가?
  • RQ2상수의 로그 및 지수 변환을 사용하는 것이 심볼릭 생성에서 모델 성능과 수치적 안정성 향상에 기여하는가?
  • RQ3예측된 상수를 초기화 값으로 사용하여 기울기 기반 미세조정을 통합할 경우, 최종 모델 정확도와 수렴 속도에 어떤 영향을 미치는가?
  • RQ4제안된 확장 인코딩 전략이 표준 상수 표현 방식에 비해 심볼릭 트랜스포머의 주의 메커니즘과 시퀀스 모델링 능력을 얼마나 향상시키는가?
  • RQ5특히 R²와 상대 오차 측면에서 벤치마크 데이터셋에서 최신 기술 수준의 심볼릭 회귀 방법과 비교해 SymFormer의 성능과 추론 속도는 어떠한가?

주요 결과

  • Top-K 샘플링(K=20)과 256개의 샘플을 사용하여 벤치마크 데이터셋에서 SymFormer는 R² = 1.0000 및 상대 오차 0.0010을 달성하며 기존 방법을 크게 능가합니다.
  • 절단 실험 결과, 훈련 중 상수 예측이 성능 향상에 기여하는 것으로 확인되었습니다: 상수 예측 기반 기본 인코딩(R² = 0.9979, 오차 = 0.0669)이 상수 없이 학습된 모델(R² = 0.9929, 오차 = 0.1547)보다 성능이 뛰어납니다.
  • 기울기 기반 미세조정을 통한 확장 인코딩 전략이 가장 우수한 결과를 도출했습니다(R² = 1.0000, 오차 = 0.0010), 이는 적절한 상수 표현 방식이 모델의 일반화 능력과 주의 메커니즘 향상에 기여함을 시사합니다.
  • SymFormer의 추론 속도는 진화적 방법보다 빠르며, 추론 시간이 초 단위 수준이어서 실시간 응용에 적합합니다.
  • 모델는 강력한 외삽 능력을 보이며, 훈련 입력 범위를 초월한 영역에서도 잘 일반화됨을 분포 외 테스트를 통해 검증했습니다.
  • 정성 분석 결과, SymFormer는 데이터로부터 복잡한 수학적 관계(예: 푸리에 유사 분해)를 회복할 수 있으며, 다양한 수식으로 사전 훈련한 데서 기인한 강력한 인덕티브 바이어스를 지닌 것으로 나타났습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.