Skip to main content
QUICK REVIEW

[論文レビュー] Hammering Mizar by Learning Clause Guidance

Jan Jakubův, Josef Urban|arXiv (Cornell University)|Apr 2, 2019
Logic, programming, and type systems参考文献 27被引用数 20
ひとこと要約

本論文は、Mizar数学図書館全体において、E自動定理証明系のリアルタイム証明性能を70%向上させる手法を提示している。これは、内部の節選択を指導するための機械学習を統合することで達成された。反復的学習により、証明トレースから学習する(ハッシュ化された節特徴量を用いたXGBoost)、システムは次第に効果的な証明戦略へ進化し、大規模理論における形式的定式化において、エンド・ツー・エンドで学習された内部指導が、手動で最適化された戦略を上回ることを示している。

ABSTRACT

We describe a very large improvement of existing hammer-style proof automation over large ITP libraries by combining learning and theorem proving. In particular, we have integrated state-of-the-art machine learners into the E automated theorem prover, and developed methods that allow learning and efficient internal guidance of E over the whole Mizar library. The resulting trained system improves the real-time performance of E on the Mizar library by 70% in a single-strategy setting.

研究の動機と目的

  • 大規模なインタラクティブ定理証明(ITP)図書館における自動定理証明系のリアルタイム性能を向上させること。
  • 既存のハムマーの限界に対処すること。ハムマーは前提選択にのみ焦点を当てており、内部証明探索の指導には対応していない。
  • Eのような飽和ベースのATPにおいて、Mizarのような大規模図書館を対象に、スケーラブルで効率的な内部節選択の学習手法を開発すること。
  • エンド・ツー・エンドの機械学習が、大規模理論における証明探索で人間が設計した戦略を上回るかを評価すること。

提案手法

  • XGBoost勾配ブースティング木をE定理証明系に統合し、学習された重みを用いて与えられた節の選択を指導する。
  • 特徴量ハッシングを用いて、高次元で手作業で設計された節特徴量を管理可能な65,536次元の空間に圧縮し、モデル性能を維持しながら効率性を向上させる。
  • MaLARea風のフィードバックループを適用:Mizar図書館上でEを実行し、成功した証明から正例/負例を抽出し、分類器を再学習して改善された戦略を再適用する。
  • 26,107の問題から得た6300万件の証明探索例を用いてモデルを学習し、木の深さを9、12、16と段階的に増加させることで性能への影響を評価する。
  • ベースラインE戦略と学習済みモデル(記号 ⊕ を用いて表記)を組み合わせたパフォルマンス戦略を採用し、耐性と解法カバレッジを向上させる。
  • 推論速度、モデルサイズ、学習時間を測定することで、学習された指導システムのスケーラビリティと効率性を評価する。

実験結果

リサーチクエスチョン

  • RQ1機械学習に基づく内部節選択は、Mizarのような大規模ITP図書館における飽和ベースATPのリアルタイム性能を顕著に向上させることができるか?
  • RQ2手作業で設計された特徴量を一切使わず、エンド・ツー・エンドで節選択を学習することは、大規模証明探索において、従来の特徴量設計手法を上回るか?
  • RQ3証明トレースからの反復的学習は、戦略の改善を複数ラウンドにわたりどのように累積的に向上させるか?
  • RQ4特徴量ハッシングは、数百万件の証明例に対するスケーラブルな学習を可能にしつつ、高いモデル精度を維持できるか?
  • RQ5厳密な時間制限下で、人間が最適化したベースライン戦略と比較して、学習済み戦略がどれほど多くの問題を解けるか?

主な発見

  • 最良の学習戦略であるE ⊕ M₁₆³は、60秒間で26,107の問題を解決し、ベースライン戦略に比べてリアルタイム性能で70%の向上を達成した。
  • 木の深さ16で学習した戦略は、10秒の時間制限内でも、ベースライン戦略に比べて70%の性能向上を示し、これまでのE戦略の中で最も多くの問題を解決した。
  • パフォルマンス戦略(E ⊕ M₁₆³)は、10秒ずつ実行された6戦略のパフォルマンス戦略の組み合わせに比べ、18.3%多くの問題を解決した。
  • 深さの増加により推論速度が15%低下したが、より高い精度を示す深いモデルの恩恵により、リアルタイム性能が向上した。これは、モデルの複雑さが正当化されることを示している。
  • 200本の木と2¹⁵のハッシュベースで学習したモデルは、40GBのデータと12CPU日を要したが、大規模な証明コーパスにおけるスケーラビリティを示した。
  • 反復的学習は1回目の反復を過ぎても継続的に改善をもたらし、各ラウンドで新たな解ける問題が追加され、戦略が洗練された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。