[논문 리뷰] GP-RVM: Genetic Programing-based Symbolic Regression Using Relevance Vector Machine
이 논문은 유전적 프로그래밍(GP)과 관련 벡터 머신(RVM)을 조합한 하이브리드 기호 회귀 방법인 GP-RVM을 제안한다. 이 방법은 기수 프로그래밍(Kaizen Programming)과 RVM을 결합하여 희소하고 해석 가능한 비선형 모델을 도출한다. 기존 GP와 KP보다 높은 정확도와 강건성을 달성하며, 수렴 속도가 빠르고 함수 평가 횟수가 감소한다.
This paper proposes a hybrid basis function construction method (GP-RVM) for Symbolic Regression problem, which combines an extended version of Genetic Programming called Kaizen Programming and Relevance Vector Machine to evolve an optimal set of basis functions. Different from traditional evolutionary algorithms where a single individual is a complete solution, our method proposes a solution based on linear combination of basis functions built from individuals during the evolving process. RVM which is a sparse Bayesian kernel method selects suitable functions to constitute the basis. RVM determines the posterior weight of a function by evaluating its quality and sparsity. The solution produced by GP-RVM is a sparse Bayesian linear model of the coefficients of many non-linear functions. Our hybrid approach is focused on nonlinear white-box models selecting the right combination of functions to build robust predictions without prior knowledge about data. Experimental results show that GP-RVM outperforms conventional methods, which suggest that it is an efficient and accurate technique for solving SR. The computational complexity of GP-RVM scales in $O( M^{3})$, where $M$ is the number of functions in the basis set and is typically much smaller than the number $N$ of training patterns.
연구 동기 및 목표
- 기존 기호 회귀를 위한 유전적 프로그래밍(GP)의 한계, 즉 블로팅, 느린 수렴, 비결정적 탐색을 해결하기 위해.
- 카이젠 프로그래밍(KP)의 단점인 p-값 기반 임계치 설정과 선형 모델에서의 특이성 문제를 해결하기 위해.
- 최소한의 사전 지식으로도 결정론적이고 희소하며 강건한 기호 회귀 프레임워크를 개발하고, 모델의 해석 가능성 보장을 위해.
- GP 기반 진화적 프레임워크 내에서 RVM을 특징 선택 및 모델 추정 수단으로 통합함으로써 모델 정확도와 효율성을 향상시키기 위해.
제안 방법
- 기존 카이젠 프로그래밍(KP)의 확장된 버전을 사용하여 기저 함수로 작용하는 기호 표현의 집단을 생성하고 진화시킨다.
- 단일 개체를 완전한 해로 간주하는 대신, GP-RVM은 진화된 개체들 중에서 선택된 기저 함수들의 선형 조합으로 최종 모델을 구성한다.
- 희소 베이지안 커널 방법인 관련 벡터 머신(RVM)을 사용하여 기저 함수의 사후 가중치를 예측 성능과 희소성에 기반해 결정한다.
- RVM 프레임워크는 기저 함수 계수의 희소성을 촉진하는 베이지안 사전분포를 사용함으로써 특징의 중복성과 특이성 문제를 자동으로 처리한다.
- RVM 학습의 계산 복잡도를 감소시키기 위해 순차적 희소 베이지안 학습 알고리즘을 구현하여 복잡도를 O(M³)로 줄였다. 여기서 M은 기저 함수의 수이다.
- 가설 검정을 피하기 위해 NHST 기반 특징 선택을 RVM의 내재된 모델 선택 기법으로 대체함으로써 유의수준 임계치 설정이 필요 없도록 한다.
실험 결과
연구 질문
- RQ1카이젠 프로그래밍과 RVM을 융합한 하이브리드 접근법이 표준 GP와 KP보다 기호 회귀 정확도와 수렴 속도에서 뛰어난 성능을 보일 수 있는가?
- RQ2KP에서 NHST 기반 특징 선택을 RVM 기반의 베이지안 모델 선택으로 대체할 경우, 임계치 조정이 필요 없고 특이성 문제도 해결되는가?
- RQ3RVM에 의해 유도된 희소성이 기호 회귀 기준 테스트 과제에서 모델의 해석 가능성과 일반화 성능을 얼마나 향상시키는가?
- RQ4제한된 함수 평가 횟수로 복잡한 비선형 기호 회귀 문제를 해결할 때 GP-RVM은 강건성과 효율성 면에서 어떻게 다른 방법과 비교되는가?
주요 결과
- Keijzer 함수 두 개(keijzer 2 및 3)에서 GP-RVM이 가장 높은 적합도 값을 기록했으며, KP와 5번, GP와 2번의 동점 기록을 하여 복잡한 문제에서 뛰어난 성능을 입증했다.
- Keijzer 함수에서 GP-RVM은 GP와 KP보다 훨씬 적은 함수 평가 횟수(NFEs)를 소모했으며, 특히 복잡한 목표 함수에서 수렴 속도가 더 빠르다는 것을 보였다.
- Nguyen 벤치마크 세트(F1–F10)에서 GP-RVM은 곡선 피팅 성공률 100%를 기록했으며, KP와 동일한 성능를 유지하면서 낮은 RMSE와 목표 함수 평가 횟수를 확보했다.
- 시험 결과, GP-RVM은 keijzer 1, 2, 3, 7, 8, 9 함수에서 KP보다 최대 오차가 낮아, 미리 보지 않은 데이터에 대해 더 강건한 성능를 보였다.
- 6개의 Keijzer 함수에서 GP-RVM의 중앙값 적합도는 0.99 이상이었으며, KP는 5개, GP는 4개(50 및 500 개체 수)였고, 이는 더 우수한 모델 품질을 의미한다.
- 이 방법의 계산 복잡도는 M(기저 함수의 수)에 대해 O(M³)로 스케일링되며, 일반적으로 M이 학습 샘플 수 N보다 훨씬 작기 때문에 효율성이 보장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.