Skip to main content
QUICK REVIEW

[論文レビュー] The 5th Reactive Synthesis Competition (SYNTCOMP 2018): Benchmarks, Participants & Results.

Swen Jacobs, Roderick Bloem|arXiv (Cornell University)|Apr 15, 2019
Machine Learning in Materials Science参考文献 28被引用数 20
ひとこと要約

本論文は、第5回反応的合成コンペティション(SYNTCOMP 2018)の結果を報告するものであり、時系列ストリーム論理(TSL)、ハードウェアコンポーネント、ターンアラウンド・ゲーム(Tic Tac Toe)、抽象化に基づく制御の4つの新しいベンチマーククラスを導入するとともに、LTL合成および実現可能性トラックにおける14のツールの包括的評価を実施した。STRIXがすべての公式カテゴリーで優勝し、そのポーフォリオ設定により並列モードで272件中256件のインスタンスを解決し、高品質でコンパクトな戦略を生成した。一方、BoWSer(opt,par)はすべてのツールの中で最高の平均解釈品質を達成した。

ABSTRACT

We report on the fifth reactive synthesis competition (SYNTCOMP 2018). We introduce four new benchmark classes that have been added to the SYNTCOMP library, and briefly describe the evaluation scheme and the experimental setup of SYNTCOMP 2018. We give an overview of the participants of SYNTCOMP 2018 and highlight changes compared to previous years. Finally, we present and analyze the results of our experimental evaluation, including a ranking of tools with respect to quantity and quality of solutions.

研究の動機と目的

  • 標準化され、進化を続けるベンチマークセットを用いた反応的合成ツールの性能および品質を評価・比較すること。
  • LTLおよび安全特性のスケーラブルでユーザーフレンドリーな合成技術の進展を評価すること。
  • 解釈品質、スケーラビリティ、正しさの観点から、優れたツールおよび設定を同定すること。
  • FRP、ハードウェア、ゲーム、制御システム分野における実世界の合成課題を反映する新しいベンチマーククラスを導入すること。
  • 反応的合成研究のための公開的で一貫性があり、再現可能な評価プラットフォームを維持すること。

提案手法

  • コンペティションでは、TLSFフォーマットの標準化されたベンチマークライブラリを用い、4つの新しいベンチマーククラスにまたがる272件のLTL合成インスタンスを提供した。
  • ツールは、実現可能性チェックと合成の2つのトラックで評価され、3600秒のタイムアウトを設けた順次および並列実行モードで評価された。
  • 正しさの確認のため、解釈はモデルチェックによって検証され、解釈品質は基準となるAIGER回路サイズに対する相対サイズで測定された。
  • 二重ランク付け方式が採用された:1つは解決されたインスタンス数に基づくランク付け、もう1つは解釈サイズ(品質ランク)に基づくランク付け。
  • 実験環境では、共有クラスタ上で自動実行が行われ、複数の設定での正しさとパフォーマンスの両面でツールが評価された。
  • ベンチマークセットには、FRP、ハードウェア回路、ゲーム、制御システムなどの分野からのパラメータ化および非パラメータ化例が含まれた。

実験結果

リサーチクエスチョン

  • RQ1現在の反応的合成ツールは、多様で拡張可能なLTL合成ベンチマークセットにおいて、どのように性能を発揮するか?
  • RQ2回路サイズの観点で、どのツール設定が最高の解釈品質を達成するか?また、その要因は何か?
  • RQ3並列実行モードは、順次実行モードと比較して、スケーラビリティと解釈カバレッジをどの程度向上させるか?
  • RQ4TSL や抽象化に基づく制御といった新しいベンチマーククラスの導入は、既存の合成ツールにどのような課題をもたらすか?
  • RQ5限定的合成、ポーフォリオ、最小化 vs. ラベルの選択といった異なる合成戦略は、解釈品質とパフォーマンスにどのような影響を与えるか?

主な発見

  • STRIXはLTL合成トラックのすべての公式カテゴリーで優勝し、並列モードで272件中256件のインスタンスを解決し、すべての設定の中で最高の品質スコアを達成した。
  • STRIX(ポーフォリオ)設定は、最良の順次設定より1件少ないインスタンスを解決したが、顕著に優れた解釈品質を示し、品質ランクで他のツールを上回った。
  • BoWSer(opt,par)は、すべての解決済みインスタンスにおいて最高の平均解釈品質を達成し、前回の基準解釈よりも優れた54件の解釈を生成した。
  • ltlsyntは、BoSy や BoWSer よりも常に大きな解釈を生成し、ほとんどの場合、BoSy の解釈サイズの約10倍のサイズとなった。
  • どのツールからも誤った解釈は生成されず、モデルチェッカーのタイムアウトは、異なるツールで6~23件のインスタンスで観察された。これはスケーラビリティの課題を示している。
  • 抽象化に基づく制御例を含む新ベンチマークセットは、翻訳に時間がかかりすぎるためコンペティションから除外されたが、今後の研究のためのチャレンジベンチマークとして公開された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。