Skip to main content
QUICK REVIEW

[논문 리뷰] Learning selection strategies in Buchberger's algorithm

Dylan Peifer, Michael Stillman|arXiv (Cornell University)|2020. 05. 05.
Polynomial and algebraic computation참고 문헌 30인용 수 11
한 줄 요약

이 논문은 랜덤 이항계수 시스템에서 강화학습을 사용해 그로버 기저를 계산하는 부흐버거 알고리즘의 S-페어 선택을 최적화하는 방법을 제안한다. Proximal Policy Optimization (PPO)를 사용해 에이전트를 훈련시키며, 훈련된 에이전트는 최신 기준 히우리스틱보다 다항식 덧셈을 20–40% 감소시켰다. 이는 기계학습이 기호 계산 성능을 크게 향상시킬 수 있음을 보여준다.

ABSTRACT

Studying the set of exact solutions of a system of polynomial equations largely depends on a single iterative algorithm, known as Buchberger's algorithm. Optimized versions of this algorithm are crucial for many computer algebra systems (e.g., Mathematica, Maple, Sage). We introduce a new approach to Buchberger's algorithm that uses reinforcement learning agents to perform S-pair selection, a key step in the algorithm. We then study how the difficulty of the problem depends on the choices of domain and distribution of polynomials, about which little is known. Finally, we train a policy model using proximal policy optimization (PPO) to learn S-pair selection strategies for random systems of binomial equations. In certain domains, the trained model outperforms state-of-the-art selection heuristics in total number of polynomial additions performed, which provides a proof-of-concept that recent developments in machine learning have the potential to improve performance of algorithms in symbolic computation.

연구 동기 및 목표

  • 서브옵티멀한 S-페어 선택으로 인해 발생하는 부흐버거 알고리즘의 성능 저하 문제를 해결하기 위해.
  • 강화학습이 그로버 기저 계산을 위한 우수한 선택 전략을 발견할 수 있는지 탐색하기 위해.
  • 기본적인 알고리즘 학습을 위한 적용 가능한 기준 영역으로서 이항 아이디얼을 설정하기 위해.
  • 다른 다항식 분포와 시스템 크기 간의 일반화 성능을 평가하기 위해.
  • 더 높은 변수 수의 시스템과 비이항 아이디얼로의 확장성에 대해 조사하기 위해.

제안 방법

  • 상태, 행동, 보상 구성 요소를 갖춘 강화학습 환경으로 부흐버거 알고리즘을 수리적으로 정의하였다.
  • 상태를 현재의 S-페어와 다항식 집합으로 정의하였으며, 행동은 S-페어 선택에 해당한다.
  • 감소 진행도와 다항식 덧셈 횟수를 기반으로 조밀한 보상 함수를 설계하여 정책 학습을 이끌었다.
  • 가중치 함수 부스팅을 위한 일반화된 이득 추정(GAE)을 사용한 Proximal Policy Optimization (PPO)를 사용해 딥 Q-네트워크 정책을 훈련시켰다.
  • 입력 특징으로 단항식 차수와 주도항을 인코딩한 단순 피드포워드 신경망을 정책과 가치 함수의 표현에 사용하였다.
  • 다양한 분포(균일, 가중치가 부여된)와 시스템 크기(3-20-10, 5-10-10 등)에서 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1강화학습이 부흐버거 알고리즘에서 수작업으로 만든 히우리스틱을 능가하는 효과적인 S-페어 선택 전략을 학습할 수 있는가?
  • RQ2학습된 정책의 성능는 이항계수 시스템의 다양한 분포 간에 어떻게 일반화되는가?
  • RQ3시스템 크기와 변수 수의 영향은 학습된 전략의 확장성에 어떤 영향을 미치는가?
  • RQ4비이항 아이디얼에서는 학습된 정책이 어떻게 작동하며, 희박한 다항식 시스템에 적응할 수 있는가?
  • RQ5GAE를 통한 가치 함수 근사가 훈련 안정성과 최종 성능을 크게 향상시키는가?

주요 결과

  • PPO로 훈련된 에이전트는 3-20-10 가중치가 부여된 이항계수 분포에서 최고의 벤치마크 히우리스틱 대비 총 다항식 덧셈 수를 20–40% 감소시켰다.
  • 에이전트는 근접한 분포와 시스템 크기에서 강력한 일반화 성능를 보였으며, 성능 저하가 극단적인 이질적 분포 설정에서만 발생했다.
  • 다섯 개 변수를 가진 이항계수 시스템에서, 에이전트는 5-10-10 가중치가 부여된 분포에서 최고의 벤치마크 대비 48% 적은 덧셈을 기록했다.
  • 희박한 다항식을 가진 비이항 아이디얼에서는 에이전트가 이중 성능을 보였다: 많은 경우에서 모든 벤치마크를 능가했지만, 일부 경우에서는 무작위 행동을 보여 평균 성능는 열 劣했고, 중앙값 성능는 더 좋았다.
  • GAE로 훈련된 가치 함수는 성능 향상에 핵심적인 기여를 하였으며, 모든 단계에서 완전한 롤아웃 추정을 가능하게 하여 학습 안정성과 수렴성을 향상시켰다.
  • 에이전트 정책에서 유도된 히우리스틱 'TrueDegree'는 비이항 테스트 세트에서 평균 성능가 19–33% 향상되어 최고의 벤치마크를 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.