Skip to main content
QUICK REVIEW

[논문 리뷰] Proof Artifact Co-training for Theorem Proving with Language Models

Jesse Michael Han, Jason Rute|arXiv (Cornell University)|2021. 02. 11.
Topic Modeling참고 문헌 57인용 수 6
한 줄 요약

이 논문은 리니어에서 커널 수준의 증명 항목을 활용하여 대규모 언어 모델을 위한 보조 학습 신호를 생성하는 자기지도 학습 방법인 PACT(Proof Artifact Co-training)을 소개한다. 이는 전술 예측 성능을 크게 향상시키며, 보류된 테스트 정리에서 증명 성공률를 32%에서 48%로 끌어올린다.

ABSTRACT

Labeled data for imitation learning of theorem proving in large libraries of formalized mathematics is scarce as such libraries require years of concentrated effort by human specialists to be built. This is particularly challenging when applying large Transformer language models to tactic prediction, because the scaling of performance with respect to model size is quickly disrupted in the data-scarce, easily-overfitted regime. We propose PACT ({\bf P}roof {\bf A}rtifact {\bf C}o-{\bf T}raining), a general methodology for extracting abundant self-supervised data from kernel-level proof terms for co-training alongside the usual tactic prediction objective. We apply this methodology to Lean, an interactive proof assistant which hosts some of the most sophisticated formalized mathematics to date. We instrument Lean with a neural theorem prover driven by a Transformer language model and show that PACT improves theorem proving success rate on a held-out suite of test theorems from 32\% to 48\%.

연구 동기 및 목표

  • 형식 수학에서 레이블이 부여된 데이터의 부족 문제를 해결하기 위해, 인간의 증명 형식화에 전문가가 수년간의 노력을 기울여야 하는 점을 고려한다.
  • 특히 과적합이 발생하기 쉬운 데이터가 부족한 환경에서, 대규모 언어 모델의 전술 예측 성능을 향상시키기 위해 노력한다.
  • 인간의 주석이 필요 없이 증명 항목에서 학습 신호를 추출할 수 있는 일반화 가능한 자기지도 학습 방법을 개발한다.
  • PACT를 사전 훈련(예: WebMath)과 결합했을 때, 분포를 벗어난 정리에서 더 뛰어난 일반화 능력과 성능을 보여줄 수 있음을 입증한다.

제안 방법

  • PACT는 리니어에서 기존 인간이 작성한 증명들로부터 완전히 타입이 지정되고 커널에서 검증된 증명 항목인 증명 아티팩트를 추출하여 자기지도 학습 보조 과제를 구성한다.
  • 이 방법은 트랜스포머 기반 언어 모델을 표준 전술 예측 목표와 증명 항목의 구조 및 유형 수준의 불변성에서 유도된 다수의 자기지도 목표와 함께 공동으로 훈련시킨다.
  • 증명 아티팩트를 활용해 마스킹 언어 모델링 및 재구성 과제를 만들며, 이는 모델이 형식 증명의 깊은 문법적 및 의미적 구조를 학습할 수 있도록 한다.
  • 이 방법은 리니어 3용 데이터셋 및 훈련 환경인 LeanStep에 통합되며, 감독 학습, 강화 학습, PACT 공동 학습을 모두 지원한다.
  • 성능은 보류된 검증 세트에서 모니터링되며, 점차 복잡도가 높아지는 정리의 커리큘럼을 통해 모델을 피지컬 튜닝한다.
  • PACT는 대규모 수학 텍스트(예: WebMath)에서의 사전 훈련과 결합되어 분포를 벗어난 정리에서의 일반화 능력과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1증명 아티팩트에서 자기지도 학습을 통해 데이터가 부족한 형식 수학 증명에서 전술 예측 성능을 크게 향상시킬 수 있는가?
  • RQ2표준 모방 학습과 비교했을 때, 증명 아티팩트에서의 공동 학습은 일반화 능력과 내성에 어떤 영향을 미치는가?
  • RQ3PACT는 새로운 정의나 복잡한 구조를 포함한 분포를 벗어난 정리에서 어느 정도 성능을 향상시킬 수 있는가?
  • RQ4대규모 수학 텍스트(예: WebMath)에서의 사전 훈련과 PACT를 결합하면, 각각의 방법보다 더 나은 성능을 내는가?

주요 결과

  • PACT는 보류된 테스트 세트에서 증명 성공률를 32%에서 48%로 끌어올려 데이터가 부족한 환경에서 상당한 성능 향상을 보였다.
  • PACT와 WebMath 사전 훈련의 조합은 가장 낮은 검증 손실과 가장 높은 성공률를 기록하여 상호 보완적인 이점을 보였다.
  • 수천 개의 분포를 벗어난 정리로 구성된 외부 테스트 세트에서 PACT는 37%의 성공률를 기록하여 강력한 일반화 능력을 보였다.
  • 모델는 인간이 작성한 증명보다 더 간결하고 일반적인 증명을 발견했으며, 예를 들어 원래 증명에 존재하지 않는 복소수 렘마를 사용했다.
  • 훈련 데이터에 존재하지 않는 렘마인 @norm_eq_zero를 정확한 인수 자리 표시와 함께 올바르게 추론하고 적용하는 것을 보였다.
  • PACT를 통해 생성된 증명은 `simpa [...] using @...`와 같은 고급 일관성 패턴을 자주 사용하며, 증명 자동화 패턴에 깊은 이해를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.