Skip to main content
QUICK REVIEW

[論文レビュー] Lila: A Unified Benchmark for Mathematical Reasoning

Swaroop Mishra, Matthew Finlayson|arXiv (Cornell University)|Oct 31, 2022
Topic Modeling被引用数 4
ひとこと要約

Līla は、数学的推論のための統合的ベンチマークであり、4つの次元—数学的能力、言語フォーマット、言語の多様性、外部知識—にわたる23のタスクを含み、実行可能なPythonプログラムによる解決策を有する10万件を超える例を備えている。このベンチマークは推論チェーン、一般化、耐性の評価を可能にし、提案された Bhāskara モデルは60.40%のF1スコアを達成した。マルチタスク学習により、単一タスクモデルと比較して相対的に21.83%のF1スコア向上が得られた。

ABSTRACT

Mathematical reasoning skills are essential for general-purpose intelligent systems to perform tasks from grocery shopping to climate modeling. Towards evaluating and improving AI systems in this domain, we propose LILA, a unified mathematical reasoning benchmark consisting of 23 diverse tasks along four dimensions: (i) mathematical abilities e.g., arithmetic, calculus (ii) language format e.g., question-answering, fill-in-the-blanks (iii) language diversity e.g., no language, simple language (iv) external knowledge e.g., commonsense, physics. We construct our benchmark by extending 20 datasets benchmark by collecting task instructions and solutions in the form of Python programs, thereby obtaining explainable solutions in addition to the correct answer. We additionally introduce two evaluation datasets to measure out-of-distribution performance and robustness to language perturbation. Finally, we introduce BHASKARA, a general-purpose mathematical reasoning model trained on LILA. Importantly, we find that multi-tasking leads to significant improvements (average relative improvement of 21.83% F1 score vs. single-task models), while the best performing model only obtains 60.40%, indicating the room for improvement in general mathematical reasoning and understanding.

研究の動機と目的

  • AIシステムにおける数学的推論の評価を、多様な数学的トピック、問題フォーマット、言語的スタイルにわたって包括的に行うためのベンチマークの欠如に対処すること。
  • 既存の分散型数学的推論データセットを統合し、実行可能なPythonプログラムの解決策と、インstructベース学習用のインストラクションアノテーションを追加することで、統一されたフレームワークを構築すること。
  • 専用の分布外(Līla-OOD)および摂動(Līla-Robust)スプリットを用いて、モデルの一般化および耐性の評価を可能にすること。
  • 統合ベンチマーク上で一般用途の数学的推論モデル、Bhāskara を訓練および評価し、現在のAI能力における性能とギャップを評価すること。

提案手法

  • 20の既存数学的推論データセットに、実行可能なPythonプログラムとしての推論チェーンを追加し、解決策の実行可能検証を可能にした。
  • ドメイン固有言語(DSL)からの自動変換と、熟練者による手動アノテーションを組み合わせ、DSLが利用できない場合のプログラム解決策を生成した。
  • 各例を4つの次元に分類した:数学的能力(例:算術、微積分)、言語フォーマット(例:QA、穴埋め)、言語の多様性(無言語、単純、複雑)、外部知識(一般的常識、物理学など)。
  • 2つの評価スプリットを導入:Līla-OOD は分布外一般化を、Līla-Robust は言語的摂動(例:声の変更)をテストするためのもの。
  • マルチタスク学習を用いて、Līlaベンチマーク全体で一般用途のモデルであるBhāskaraを訓練し、推論一般化を向上させた。
  • F1スコアを、すべてのテスト、OOD、耐性スプリットで評価し、正解の基準としてプログラム実行を採用した。

実験結果

リサーチクエスチョン

  • RQ1多様な数学的推論タスクを統合した統合的ベンチマークは、狭義のタスク特化型データセットを超えてAIシステムの評価を改善できるか?
  • RQ2統合ベンチマーク上でマルチタスク学習を実施した場合、単一タスク微調整と比較して、数学的推論性能はどの程度向上するか?
  • RQ3同じ基本的な数学的スキルを必要とするが、表現やフォーマットが異なる分布外の例に対して、最先端モデルはどの程度一般化できるか?
  • RQ4問題文における能動態/受動態の入れ替えや同義語置換などの言語的摂動に対して、現在のモデルはどの程度耐性を示すか?
  • RQ5包括的でプログラムアノテーション付きの数学的推論ベンチマークにおいて、現在のモデルの性能の上限はどの程度か?

主な発見

  • Bhāskara モデルは Līla ベンチマークで60.40%のF1スコアを達成し、一般数学的推論におけるさらなる改善の余地が大きいことを示した。
  • マルチタスク学習により、単一タスクモデルと比較してF1スコアが相対的に21.83%向上した。これは、多様な数学的タスク間での共同学習の利点を示している。
  • Codex は他のベースラインと比較してほとんどのデータセットで優れた性能を示し、平均F1スコア61.3%を達成。次いで GPT-3 と微調整済み GPT-Neo モデルが続いた。
  • モデルは単純で構造化された問題(例:singleop, multiarith)では高い性能を示したが、複雑な自然言語問題(例:mathqa_geometry, svamp_structured)では、特に言語が複雑または曖昧な場合に苦戦した。
  • Līla-OOD および Līla-Robust スプリットは、モデルが異なる表現や言語的バリエーションへの一般化が著しく劣っていることを明らかにした。これは、現在の推論一般化における主要な制限要因を示している。
  • 実行可能なプログラム解決策の導入により、推論チェーンの正確な評価が可能となり、モデルが誤ったまたは不適切な推論経路をたどっても正解に到達する傾向があることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。