Skip to main content
QUICK REVIEW

[논문 리뷰] Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean

Peiyang Song, Kaiyu Yang|arXiv (Cornell University)|2024. 04. 18.
Business Process Modeling and AnalysisBusiness, Management and Accounting인용 수 3
한 줄 요약

이 논문은 외부 함수 인터페이스(FFI)를 통해 대규모 언어 모델(LLM)이 레인 증명 도구 내부에서 직접 추론을 수행할 수 있도록 하는 Lean Copilot 프레임워크를 소개한다. 이는 LLM이 인간 사용자와의 협업을 통해 전략 제안, 증명 검색, 관련 전제 선택을 수행함으로써 수동 작업을 크게 줄이고, 규칙 기반 자동화보다 증명 완성도와 자율성에서 뛰어난 성능을 발휘한다.

ABSTRACT

Neural theorem proving combines large language models (LLMs) with proof assistants such as Lean, where the correctness of formal proofs can be rigorously verified, leaving no room for hallucination. With existing neural theorem provers pretrained on a fixed collection of data and offering valuable suggestions at times, it is challenging for them to continually prove novel theorems in a fully autonomous mode, where human insights may be critical. In this paper, we explore LLMs as copilots that assist humans in proving theorems. We introduce Lean Copilot, a general framework for running LLM inference natively in Lean. It enables programmers to build various LLM-based proof automation tools that integrate seamlessly into the workflow of Lean users. Lean users can use our pretrained models or bring their own ones that run either locally (with or without GPUs) or on the cloud. Using Lean Copilot, we build LLM-based tools that suggest proof steps, complete proof goals, and select relevant premises. Experimental results on the Mathematics in Lean textbook demonstrate the effectiveness of our method compared to existing rule-based proof automation in Lean (aesop). When assisting humans, Lean Copilot requires only 2.08 manually-entered proof steps on average (3.86 required by aesop); when automating the theorem proving process, Lean Copilot automates 74.2% proof steps on average, 85% better than aesop (40.1%). We open source all code and artifacts under a permissive MIT license to facilitate further research.

연구 동기 및 목표

  • 완전히 자율적인 LLM 기반 증명 도구가 인간의 통찰력이 부족하여 새로운 또는 도메인 간 거리가 먼 정리를 다루는 데 어려움을 겪는 문제를 해결하기 위해.
  • 상호작용 증명 도구(Interactive Theorem Proving, ITP)에서 인간과 AI의 협업 패러다임을 탐색하여, LLM이 반복적인 증명 단계를 자동화하고 인간이 고수준의 지침을 제공하는 보조자 역할을 할 수 있도록 하기 위해.
  • 레인 증명 환경 내부에 직접 LLM 추론을 통합할 수 있도록 하는 일반적이고 확장 가능한 프레임워크를 구축하여 외부 모델 호출의 한계를 극복하기 위해.
  • 레인에서 기존 규칙 기반 시스템과의 비교를 통해 LLM 기반 증명 자동화 도구—전략 제안, 증명 검색, 전제 선택—의 실증적 평가를 수행하기 위해.
  • MIT 라이선스 하에 프레임워크와 모델을 오픈소스로 제공하여 LLM 기반 형식 수학 및 검증 분야의 연구를 가속화하기 위해.

제안 방법

  • 외부 함수 인터페이스(FFI)를 활용하여 LLM 추론을 레인 환경 내부에서 직접 실행함으로써 레인과 LLM 간의 저지연, 내재된 상호작용을 가능하게 한다.
  • CTranslate2를 통한 로컬 추론(GPU 유무 관계 없이)과 원격 서버 기반 LLM 배포를 모두 지원하여 배포 및 모델 선택의 유연성을 확보한다.
  • 세 가지 LLM 기반 도구를 도입: `suggest_tactics`는 다음 증명 단계를 생성하고, `search_proofs`는 종단 간 증명 검색을 수행하며, `select_premises`는 Mathlib에서 관련 정리들을 검색한다.
  • Mathlib와 'Mathematics in Lean'의 정리 및 증명 데이터를 포함한 형식 수학 데이터로 미세조정된 LLM을 사용하여 관련성과 정확도를 향상시킨다.
  • 사용자가 자체 모델(미세조정 또는 사전학습된 모델)을 플러그인할 수 있는 모듈러 아키텍처를 채택하여 맞춤형 증명 자동화 파이프라인을 구축할 수 있도록 한다.
  • 레인의 타입 체크 및 증명 체크 워크플로우 내부에서 LLM 호출을 동기적으로 실행함으로써 정확성을 보장하고 상호작용 증명 중 실시간 지원을 가능하게 한다.

실험 결과

연구 질문

  • RQ1LLM이 자율적 에이전트가 아니라 보조자 역할을 하여 인간 사용자가 상호작용 증명에 효과적으로 참여하도록 돕는 데 성공할 수 있는가?
  • RQ2레인 내부에서 직접 LLM 추론을 수행하는 것과 외부 모델 호출을 비교했을 때 사용성, 지연 시간, 통합 깊이 측면에서 어떤 차이가 있는가?
  • RQ3전략 제안, 증명 검색, 전제 선택과 같은 LLM 기반 도구가 정리 증명에 필요한 인간이 입력한 전략 수를 얼마나 줄일 수 있는가?
  • RQ4LLM 기반 증명 자동화는 Aesop과 같은 규칙 기반 시스템과 비교해 증명 자율성과 자동화 커버리지 측면에서 어떻게 다른가?
  • RQ5레인 내에서 LLM 추론을 위한 일반 목적의 프레임워크는 형식 검증 및 수학 분야에서 LLM 기반 증명 도구의 광범위한 채택과 확장 가능성을 어떻게 가능하게 하는가?

주요 결과

  • Lean Copilot는 `search_proofs` 도구를 사용할 경우 평균적으로 정리당 인간이 입력한 전략 수를 1.02로 줄여, Aesop(3.62)와 `suggest_tactics`(2.72)를 크게 앞서는 성능을 보였다.
  • `search_proofs` 도구는 64%의 정리를 자율적으로 증명했으며, `suggest_tactics`의 34% 성공률보다 두 배 이상 높고, Aesop의 12%보다 다섯 배 이상 높았다.
  • 평균적으로 `search_proofs`는 증명 단계의 81.2%를 자동화했으며, `suggest_tactics`의 48.6%와 Aesop의 35.2%에 비해 종단 간 증명 완성도가 뛰어났다.
  • 이 프레임워크는 LLM이 레인에 내재적으로 통합될 수 있도록 하여 외부 프로세스 의존 없이 실시간으로 저지연 지원을 가능하게 했다.
  • MIT 라이선스 하에 오픈소스로 제공된 코드베이스와 모델은 향후 LLM 기반 형식 추론 및 증명 자동화 분야의 연구 기반을 마련했다.
  • 실증 결과는 LLM이 보조자 역할을 할 경우 반복적인 증명 단계를 처리함으로써 정리 증명 속도를 크게 향상시키고, 형식 수학 및 검증 분야에서 인간의 생산성을 향상시킬 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.