Skip to main content
QUICK REVIEW

[논문 리뷰] Draft, Sketch, and Prove: Guiding Formal Theorem Provers with Informal Proofs

Albert Q. Jiang, Sean Welleck|arXiv (Cornell University)|2022. 10. 21.
Logic, programming, and type systems인용 수 25
한 줄 요약

DSP 방법은 비공식 증명을 형식적 증명 초안으로 변환하여 자동 정리기가 가이드하도록 하여 Isabelle의 miniF2F 증명 성공률을 기초값 약 20%에서 대략 39%(인간의 증명) 또는 언어 모델 증명으로 최대 38-39%로 크게 증가시킨다.

ABSTRACT

The formalization of existing mathematical proofs is a notoriously difficult process. Despite decades of research on automation and proof assistants, writing formal proofs remains arduous and only accessible to a few experts. While previous studies to automate formalization focused on powerful search algorithms, no attempts were made to take advantage of available informal proofs. In this work, we introduce Draft, Sketch, and Prove (DSP), a method that maps informal proofs to formal proof sketches, and uses the sketches to guide an automated prover by directing its search to easier sub-problems. We investigate two relevant setups where informal proofs are either written by humans or generated by a language model. Our experiments and ablation studies show that large language models are able to produce well-structured formal sketches that follow the same reasoning steps as the informal proofs. Guiding an automated prover with these sketches enhances its performance from 20.9% to 39.3% on a collection of mathematical competition problems.

연구 동기 및 목표

  • 형식적 증명의 부족 문제를 풍부한 비공식 증명을 활용하여 해결한다.
  • 비공식 증명을 형식적 증명 스케치로 변환하여 자동 증명을 안내한다.
  • Isabelle의 miniF2F에서 인간 작성과 언어 모델 생성 증명을 사용하여 DSP를 평가한다.

제안 방법

  • 세 단계로 구성된 DSP를 도입한다: 비공식 증명을 초안 작성하고, few-shot 자동 형식화(few-shot autoformalization)를 통해 형식적 증명 스케치로 매핑하며, 자동 증명기로 격차를 메운다.
  • 비공식 증명으로부터 형식적 스케치를 생성하기 위해 최대 175B 매개변수의 대형 언어 모델을 사용한다.
  • 비공식 증명(인간 또는 LM)을 형식적 스케치와 짝지어 일반적인 증명기를 적용하여 오픈 추측을 종결한다.
  • Isabelle의 miniF2F 문제를 대상으로 실험하고, Sledgehammer를 휴리스틱을 포함한 베이스라인으로 사용하며 Thor 기반 베이스라인과 비교한다.
  • 인라인 주석, 비공식 증명의 초안 작성, 자동 증명기의 영향력을 평가하기 위한 제거 실험(ablations)을 수행한다.
  • Codex, 다양한 규모의 Minerva 등 모델 변형과 인간 증명을 분석하여 효과성 및 암기(memory) 우려를 평가한다.

실험 결과

연구 질문

  • RQ1비공식 증명이 형식적 증명 스케치를 통해 자동 증명을 효과적으로 안내할 수 있는가?
  • RQ2인간 증명과 언어 모델 증명의 사용이 Isabelle에서의 형식화 성공에 어떤 영향을 미치는가?
  • RQ3인라인 주석, 초안 작성, 자동 증명기의 제거 실험이 DSP의 성능 및 확장성에 어떤 영향을 미치는가?

주요 결과

  • DSP는 miniF2F에서 자동 증명기로 해결된 문제 비율을 20.9%에서 38.9–39.3%로 증가시킨다(증명 소스 및 설정에 따라 다름).
  • 인간의 비공식 증명은 miniF2F 테스트에서 39.3%에 도달하고; 언어 모델 증명은 540B Minerva로 최대 38.9%, 62B Minerva로 37.7%에 도달한다.
  • Minerva 62B 및 540B는 Isabelle에서 증명자를 안내하는 데 있어 인간에 거의 필적하는 성능을 보이며, 더 작은 LM 베이스라인 및 일부 이전 신경 접근법보다 우수하다.
  • 인라인 비공식 토론 주석이 프롬프트에 있을 때 성공률이 향상되는 등 Ablation 연구에서 확인되며(검증 +4.9%, 테스트 +2.8%), 비공식 초안 제거는 성능을 감소시키고, 자동 증명기는 필수적이다(없으면 약 -9~10%).
  • DSP는 인간 증명을 사용하여 miniF2F에서 200/488 문제를, 특정 LM 구성에서는 약 199 문제를 해결하게 한다.
  • 노이즈가 있는 비공식 증명에 대해서도 접근이 견고하며, 일부 LM 증명은 비공식 추론의 잘못된 단계들을 수정하거나 활용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.