[논문 리뷰] End-to-end symbolic regression with transformers
이 논문은 변환기 기반의 종단간 기호 회귀 방법을 제안하며, 하이브리드 기호-수치 어휘를 활용해 수치 상수를 포함한 전체 수학적 표현을 직접 예측한다. 이 방법은 SRBench 벤치마크에서 최신 기법 수준의 정확도를 달성하며, 유전적 프로그래밍(GP) 수준의 성능에 근접하지만, 추론 속도가 수천 배 빠르며, 저노이즈 및 외삽 상황에서 특히 효과적이다. BFGS를 통한 정밀 조정을 통해 성능을 향상시킨다.
Symbolic regression, the task of predicting the mathematical expression of a function from the observation of its values, is a difficult task which usually involves a two-step procedure: predicting the "skeleton" of the expression up to the choice of numerical constants, then fitting the constants by optimizing a non-convex loss function. The dominant approach is genetic programming, which evolves candidates by iterating this subroutine a large number of times. Neural networks have recently been tasked to predict the correct skeleton in a single try, but remain much less powerful. In this paper, we challenge this two-step procedure, and task a Transformer to directly predict the full mathematical expression, constants included. One can subsequently refine the predicted constants by feeding them to the non-convex optimizer as an informed initialization. We present ablations to show that this end-to-end approach yields better results, sometimes even without the refinement step. We evaluate our model on problems from the SRBench benchmark and show that our model approaches the performance of state-of-the-art genetic programming with several orders of magnitude faster inference.
연구 동기 및 목표
- 두 단계 기반 기호 회귀의 한계를 극복하기 위해, 스켈레톤 예측과 상수 피팅이 분리되어 오류가 발생하기 쉬운 점을 해결한다.
- 딥 러닝을 활용해 수치 상수를 포함한 완전한 수학적 표현을 직접, 종단간으로 예측할 수 있도록 한다.
- 높은 정확도를 유지하면서도 최신 기법인 유전적 프로그래밍(GP) 방법보다 추론 속도와 강인성을 향상시킨다.
- 기존 딥 러닝 기반 SR 모델이 D ≤ 3에 국한된 것에 비해, 최대 10개의 입력 특징을 가진 문제로의 확장성을 입증한다.
- 노이즈 및 외삽에 대한 강인성을 평가하고, 모델 예측을 통한 정보 기반 초기화가 비凸 최적화에서 성공률을 향상시킬 수 있음을 보여준다.
제안 방법
- 모델는 연산자, 변수, 수치 상수를 포함한 하이브리드 기호-수치 어휘를 사용하여, 전체 수학적 표현의 순차적 생성을 종단간으로 가능하게 한다.
- 합성 데이터셋에서 훈련된 변환기 기반 아키텍처를 사용하여, 스켈레톤 예측을 생략하고 입력-출력 쌍에서 직접 전체 수식을 예측한다.
- 예측 후, 예측된 상수를 정보 기반 초기값으로 사용해 BFGS 최적화를 통해 출력을 정밀 조정함으로써 수렴성과 정확도를 향상시킨다.
- 기존 모델이 D≤3에 국한된 것과 달리, 고차원 문제(D=10까지)에 대응하기 위해 특수한 토큰화 및 생성 기법을 도입한다.
- 훈련 데이터는 사전 정의된 수학적 수식 문법에서 샘플링하여 합성되며, 다양한 실질적인 훈련 예제를 보장한다.
- 추론 속도가 향상되어, 변환기의 단일 순방향 전파 후 단일 BFGS 호출로 실시간 배포가 가능하다.
실험 결과
연구 질문
- RQ1변환기 모델이 중간 단계의 스켈레톤 예측 없이, 수치 상수를 포함한 전체 수학적 표현을 직접 예측할 수 있으며, 경쟁 가능한 성능을 달성할 수 있는가?
- RQ2스켈레톤 기반 방법과 비교해 종단간 예측과 함께 상수 동시 추정이 정확도와 강인성을 향상시키는가?
- RQ3예측된 상수가 BFGS 최적화의 효과적인 초기값으로 기능하는가? 비凸 최적화에서 실패율을 낮출 수 있는가?
- RQ4노이즈 및 분포 외부 설정을 포함한 다양한 기호 회귀 문제에서 추론 속도, 정확도, 일반화 능력 측면에서 모델의 성능은 어떠한가?
- RQ5기존 딥 러닝 기반 SR 방법이 D≤3에 국한된 것과 비교해, 고차원 문제(D > 3)에 대해 얼마나 잘 일반화되는가?
주요 결과
- 종단간 모델은 SRBench 벤치마크에서 최신 기법인 유전적 프로그래밍(예: Operon) 수준의 테스트 정확도를 2% 이내로 달성하며, GP 기반 방법보다 추론 속도가 최대 1000배 빠르다.
- Feynman 문제에서 평균 정확도(R² > 0.99)로 4위를 기록했지만, 상위 GP 모델보다 수식의 복잡도가 훨씬 낮다.
- BFGS 정밀 조정을 통해 모델은 레이블 노이즈에 매우 강인하며, 고노이즈 조건에서 스켈레톤 전용 모델보다 뛰어난 성능을 보였다.
- 외삽에 대해 잘 일반화되어 있으며, 훈련 분포를 훨씬 초월하는 테스트 입력 스케일 σ = 32에서도 합리적인 성능을 유지한다.
- 10개의 입력 특징까지 확장 가능하며, 이는 기존 딥 러닝 기반 SR 모델이 D ≤ 3에 국한된 것에 비해 상당한 향상이다.
- 절단 분석 결과, 상수 예측를 포함한 종단간 훈련이 스켈레톤 기반 접근보다 더 우수한 성능을 내며, 정밀 조정 없이도 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.