Skip to main content
QUICK REVIEW

[논문 리뷰] A divide and conquer method for symbolic regression

Changtong Luo, Chen Chen|arXiv (Cornell University)|2017. 05. 23.
Evolutionary Algorithms and Applications참고 문헌 10인용 수 9
한 줄 요약

이 논문은 기능 분리성( separability )을 활용하여 유전적 프로그래밍(GP)의 수렴 속도를 높이는 분할정복(D&C) 방법을 제안한다. 새로운 双-상관관계 검증(Bi-Correlation Test, BiCT)을 통해 분리 가능한 부분 함수를 탐지함으로써, 복잡한 목표 함수를 더 단순한 구성 요소로 분해함으로써 빠른 수렴을 가능하게 하였다. 실제 응용에서 계산 시간을 수십만 배로 감소시키는 등, 일반성에 손상을 주지 않고도 성능 향상을 이룬다.

ABSTRACT

Symbolic regression aims to find a function that best explains the relationship between independent variables and the objective value based on a given set of sample data. Genetic programming (GP) is usually considered as an appropriate method for the problem since it can optimize functional structure and coefficients simultaneously. However, the convergence speed of GP might be too slow for large scale problems that involve a large number of variables. Fortunately, in many applications, the target function is separable or partially separable. This feature motivated us to develop a new method, divide and conquer (D&C), for symbolic regression, in which the target function is divided into a number of sub-functions and the sub-functions are then determined by any of a GP algorithm. The separability is probed by a new proposed technique, Bi-Correlation test (BiCT). D&C powered GP has been tested on some real-world applications, and the study shows that D&C can help GP to get the target function much more rapidly.

연구 동기 및 목표

  • 많은 변수를 포함한 대규모 기호 회귀 문제에서 유전적 프로그래밍(GP)의 느린 수렴 문제를 해결하기 위해.
  • 실제 함수에서 흔히 나타나는 분리성 또는 부분 분리성 구조적 특성을 활용하여 최적화 효율을 향상시키기 위해.
  • 복잡한 함수를 부분 함수로 분해하여 독립적인 GP 최적화를 수행할 수 있는 체계적 방법을 개발하기 위해.
  • 분해에 적합한 변수 조합을 식별하기 위해 새로운 분리성 탐지 기법인 이중 상관관계 검증(BiCT)을 도입하기 위해.
  • D&C 접근법이 기호 회귀의 일반성은 유지하면서도 계산 비용을 크게 감소시킬 수 있음을 입증하기 위해.

제안 방법

  • 검출된 분리성에 기반해 목표 함수를 부분 함수로 분해하고, 각 부분 함수를 독립적으로 GP를 통해 최적화한다.
  • 목표 함수 내에서 변수의 부분 집합이 분리 가능하거나 부분적으로 분리 가능한지 탐지하기 위해 새로운 기법인 이중 상관관계 검증(BiCT)을 제안한다.
  • 프로그램을 정수 문자열로 표현하는 기반 기반의 프로그램 표현 방식인 Parse-Matrix Evolution(PME)를 사용하여 부분 함수를 최적화한다. 이는 효율적인 탐색을 가능하게 한다.
  • 최적화된 부분 함수들로부터 전체 모델을 재구성하며, 계산 비용은 복잡도 모델(식 15)을 통해 추정한다.
  • 분리성은 서로소인 변수 부분집합 위에서 부분 함수의 복합함수 형태로 수학적으로 정의된다.
  • 가스 역학 분야의 실제 방정식을 대상으로 적용하여 효율성과 정확성을 검증하였다.

실험 결과

연구 질문

  • RQ1기호 회귀 문제에서 함수의 분리성이 신뢰성 있게 탐지되어 효율적인 분해가 가능한가?
  • RQ2목표 함수가 분리 가능한 부분 함수로 분해될 경우, 기호 회귀의 수렴 속도는 얼마나 빨라지는가?
  • RQ3분할정복 접근법은 계산 비용을 크게 감소시키면서도 기호 회귀의 일반성을 유지하는가?
  • RQ4이중 상관관계 검증(BiCT)은 기존 방법에 비해 분리 가능한 변수 조합을 얼마나 더 잘 식별하는가?
  • RQ5표준 GP에 비해 D&C 방법은 실세계 공학 데이터로부터 정확하거나 근사 정확한 기호 표현을 더 효율적으로 복원할 수 있는가?

주요 결과

  • 2변수 기호 회귀 문제(식 1)에서 CPU 시간을 12분 26초에서 11.2초로 단축시켜 약 67배의 속도 향상을 달성하였다.
  • 5변수 문제(식 2)에서는 D&C 없이 GP를 사용할 경우 85분 43초가 소요되었으나, D&C 적용 시 18.3초로 약 280배 이상의 속도 향상을 기록하였다.
  • 이중 상관관계 검증(BiCT)은 두 테스트 케이스 모두에서 분리 가능한 변수 조합을 성공적으로 탐지하여 정확한 분해를 가능케 하였다.
  • 표준 GP가 정확한 기호 형태를 회복하지 못한 경우에도 D&C 방법은 이중 정밀도에서 항상 피팅 오차가 0.0(1−R²=0.0)인 모델을 생성하였다.
  • D&C 방법의 계산 복잡도는 O(10⁷)로 추정되었으며, 전체 GP 접근법의 O(10¹⁰)에 비해 훨씬 낮아 순서 수준의 성능 향상이 확인되었다.
  • 높은 정확도와 일반성을 유지하며, 비선형성 및 비분리성 조합을 포함한 두 테스트 케이스 모두에서 정확한 기호 형태를 회복하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.