Skip to main content
QUICK REVIEW

[論文レビュー] New developments in parsing Mizar

Czesław Byliński, Jesse Alama|arXiv (Cornell University)|Apr 30, 2012
Logic, programming, and type systems参考文献 14被引用数 9
ひとこと要約

本稿では、Mizar言語のための新しいパーサー技術を提示し、構文解析を単純化し、独立したパーサー処理を可能にする2つの正規化スキーム—Weakly Strict Mizar (WSM) および More Strict Mizar (MSM) —を導入する。重複記号の解消、完全な括弧化、すべての論理式へのラベル付け、変数参照の直列化により、著者たちはMizarテキストの堅牢でツールに依存しない処理を可能にした。この手法は、HTTPベースのパーサーサービス、フォーマット整列、Mizar数学図書館(MML)の大規模なリファクタリングへの応用を含む。

ABSTRACT

The Mizar language aims to capture mathematical vernacular by providing a rich language for mathematics. From the perspective of a user, the richness of the language is welcome because it makes writing texts more "natural". But for the developer, the richness leads to syntactic complexity, such as dealing with overloading. Recently the Mizar team has been making a fresh approach to the problem of parsing the Mizar language. One aim is to make the language accessible to users and other developers. In this paper we describe these new parsing efforts and some applications thereof, such as large-scale text refactorings, pretty-printing, HTTP parsing services, and normalizations of Mizar texts.

研究の動機と目的

  • Mizar言語の構文的複雑性—豊富で柔軟な構文、過剰なオーバーロード、従属型の多用に起因する—を軽減すること。
  • Mizar数学図書館(MML)へのアクセスを必要とせず、Mizarツールチェイン全体に依存しない形で、開発者や研究者がMizarテキストをパースできるようにすること。
  • 構造的パースツリーと標準化されたテキスト形式を公開することで、リファクタリング、フォーマット整列、正規化といった大規模なテキスト変換を支援すること。
  • 標準化された機械可読形式を提供することで、Mizarと相互運用可能な外部ツールやサービスの作成を容易にすること。
  • さらなる構文的推論と処理の単純化を目指し、『制約なしMizar』(WRM)のような新しい正規化パラダイムを検討すること。

提案手法

  • Bisonのような標準的なLRパーサーと互換性を持つように、明示的な括弧と空白を用いて、オーバーロード記号の解消を図る、Weakly Strict Mizar (WSM) 正規化の設計。
  • すべての論理式へのラベル付け、変数名の直列化、暗黙の論理的リンク(例:'then')の明示的ラベル参照への置換を含む、構文の標準化を強制するMore Strict Mizar (MSM) 正規化の実装。
  • Mizarテキストを受け取り、XMLパースツリー、WSM/MSM変換、またはフォーマット整列済み形式を返すHTTPベースのパーサーサービスの開発。これにより、ローカルツールのインstallationなしでプログラム的アクセスが可能になる。
  • 正規化およびパーサーパイプラインのスケーラビリティと正しさを評価するため、Mizar数学図書館(MML)をテストベッドとして用いる。
  • 既存のMizarテキストのXML表現を活用して意味論的分析を行う一方で、正確な構造的忠実性を要するタスクに適した、新たな構文レベルのツールを導入する。
  • MMLのリファクタリングに正規化を適用し、下流処理の単純化と静的解析、外部ツールとの統合を促進する。

実験結果

リサーチクエスチョン

  • RQ1Mizar言語の構文的複雑性—特にオーバーロードと従属型に起因する—をどのように軽減し、独立したパーサー処理を可能にするか。
  • RQ2どのような正規化戦略が、Mizarテキストを、意味的に忠実でありながらBisonのような標準パーサーと互換性のある形式に変換できるか。
  • RQ3構文の標準化(例:論理式ラベル付け、変数分類)によって、意味論的分析なしに、使用状況やスコープに関する自動推論をどの程度可能にするか。
  • RQ4HTTPベースのサービスは、Mizarシステムのインstallationなしに、外部ツールや研究者にMizarパーサー機能をどのように公開できるか。
  • RQ5正規化されたMizarテキストのパフォーマンスおよび構造的特徴は何か。また、元の図書館と比較して、行長さや複雑さの観点でどう異なるか。

主な発見

  • WSM正規化により、標準的なLRパーサーで処理可能な形式にMizarテキストが変換された。MMLに正規化された60%の記事で、1行あたり500文字以上の長さの行が存在し、平均行長は54.7文字であった。
  • MSM正規化により、意味論的分析なしに構文のみで推論が可能となり、変数の種別(束縛 vs. 自由)や、ラベルベースの参照による論理式の使用状況を特定できるようになった。
  • HTTPベースのパーサーサービスにより、外部ツールがMizarテキストを送信し、XMLパースツリー、WSM、MSM、フォーマット整列済み形式といった構造的出力を得られるようになった。MMLやMizarツールへのアクセスを必要としない。
  • Mizar数学図書館(4.181.1147)のWSM化されたバージョンには、500文字を超える行を含む694件の記事があり、最長の行は6042文字に達しており、実世界の状況下でも正規化のスケーラビリティが裏付けられた。
  • 著者たちは『制約なしMizar』(WRM)バージョンの実験を開始し、予約変数を排除することで、構造的手がかりのみで意味的解釈をさらに単純化することを目的としている。
  • 新しい正規化とサービスは、すでに大規模なリファクタリング、フォーマット整列、外部ツールとの統合を可能にし、理論的パーサーの範囲を越えた実用的価値を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。