Skip to main content
QUICK REVIEW

[論文レビュー] Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean

Peiyang Song, Kaiyu Yang|arXiv (Cornell University)|Apr 18, 2024
Business Process Modeling and AnalysisBusiness, Management and Accounting被引用数 3
ひとこと要約

この論文では、外部関数インターフェース(FFI)を介して、大規模言語モデル(LLM)がLean証明器内ですべての推論をネイティブに実行できるフレームワーク「Lean Copilot」を紹介する。LLMは人間のユーザーのコ-pilotとして、戦略の提案、証明の探索、関連する前提の選択を行うことで、人的作業を著しく削減し、ルールベースの自動化よりも証明完了性と自律性において優れている。

ABSTRACT

Neural theorem proving combines large language models (LLMs) with proof assistants such as Lean, where the correctness of formal proofs can be rigorously verified, leaving no room for hallucination. With existing neural theorem provers pretrained on a fixed collection of data and offering valuable suggestions at times, it is challenging for them to continually prove novel theorems in a fully autonomous mode, where human insights may be critical. In this paper, we explore LLMs as copilots that assist humans in proving theorems. We introduce Lean Copilot, a general framework for running LLM inference natively in Lean. It enables programmers to build various LLM-based proof automation tools that integrate seamlessly into the workflow of Lean users. Lean users can use our pretrained models or bring their own ones that run either locally (with or without GPUs) or on the cloud. Using Lean Copilot, we build LLM-based tools that suggest proof steps, complete proof goals, and select relevant premises. Experimental results on the Mathematics in Lean textbook demonstrate the effectiveness of our method compared to existing rule-based proof automation in Lean (aesop). When assisting humans, Lean Copilot requires only 2.08 manually-entered proof steps on average (3.86 required by aesop); when automating the theorem proving process, Lean Copilot automates 74.2% proof steps on average, 85% better than aesop (40.1%). We open source all code and artifacts under a permissive MIT license to facilitate further research.

研究の動機と目的

  • 完全に自律的なLLMベースの定理証明器には、人間の直観が欠如しているため、新規またはドメインが異なる定理に対して困難を抱えるという限界を是正すること。
  • インタラクティブ定理証明(ITP)における人間とAIの協働パラダイムを検討し、LLMが日常的な証明ステップを自動化しながら、人間が上位レベルの指針を提供するコ-pilotとして機能すること。
  • LLMの推論をLean証明環境に直接統合できる汎用的かつ拡張可能なフレームワークを構築し、外部モデル呼び出しの制限を克服すること。
  • LLMベースの証明自動化ツール(戦略の提案、証明探索、前提の選択)を、既存のルールベースのシステムと比較して、Leanにおける実証的評価を行うこと。
  • MITライセンスの下でフレームワークとモデルをオープンソース化し、LLMを活用した形式的数学および検証分野の研究を加速すること。

提案手法

  • 外部関数インターフェース(FFI)を活用し、LLMの推論をLean環境内ですべてネイティブに実行することで、LeanとLLMの間で低遅延な直接的相互作用を実現する。
  • CTranslate2を介したローカル推論(GPU有無を問わず)とリモートサーバー基盤のLLMデプロイメントを両方サポートし、デプロイメントとモデル選択の柔軟性を提供する。
  • 3つのLLMベースのツールを導入:`suggest_tactics`(次の証明ステップを生成)、`search_proofs`(エンドツーエンドの証明探索)、`select_premises`(Mathlibからの関連する補題を検索)。
  • Mathlibや『Mathematics in Lean』からの定理と証明の形式的数学データを用いた微調整により、関連性と正しさを向上させる。
  • ユーザーが独自のモデル(事前学習済みまたは微調整済み)をプラグインできるモジュラーなアーキテクチャを採用し、カスタム証明自動化パイプラインを可能にする。
  • LLM呼び出しをLeanの型チェックおよび証明チェックワークフロー内ですべて同期的に実行することで、正しさを保証し、インタラクティブ証明中のリアルタイム支援を可能にする。

実験結果

リサーチクエスチョン

  • RQ1LLMが自律的エージェントではなく、コ-pilotとして人間ユーザーを支援することで、インタラクティブ定理証明において効果的に機能できるか?
  • RQ2外部モデル呼び出しと比較して、Lean内でのネイティブなLLM推論は、使いやすさ、遅延、統合の深さにおいてどのように異なるか?
  • RQ3戦略の提案、証明探索、前提の選択といったLLMベースのツールは、定理を証明するために人間が入力する戦略の数をどの程度削減できるか?
  • RQ4LLMを活用した証明自動化は、Aesopのようなルールベースのシステムと比較して、証明の自律性と自動化カバレッジの面でどのように異なるか?
  • RQ5LeanにおけるLLM推論の汎用的フレームワークは、形式的検証および数学分野におけるLLMベースの証明ツールの広範な採用と拡張を可能にするか?

主な発見

  • Lean Copilotにより、`search_proofs`ツールを用いることで、1定理あたりの平均的な人間による戦略入力回数が1.02にまで低下し、Aesop(3.62)や`suggest_tactics`(2.72)を大きく上回った。
  • `search_proofs`ツールは64%の定理を自律的に証明した—これは`suggest_tactics`の34%の2倍以上、Aesopの12%の5倍以上に相当する。
  • 平均して、`search_proofs`は証明ステップの81.2%を自動化した。これは、`suggest_tactics`の48.6%、Aesopの35.2%と比較して、エンドツーエンドの証明完了性に優れていることを示している。
  • このフレームワークにより、LLMがLeanにネイティブに統合され、外部プロセス依存なしにリアルタイムかつ低遅延の支援が可能になった。
  • MITライセンスの下でオープンソース化されたコードベースとモデルは、LLMを活用した形式的推論および証明自動化分野における今後の研究の基盤を提供する。
  • 実証的結果から、LLMをコ-pilotとして活用することで、日常的な証明ステップを処理できるため、形式的数学および検証分野における人間の生産性が著しく向上することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。