Skip to main content
QUICK REVIEW

[논문 리뷰] Lila: A Unified Benchmark for Mathematical Reasoning

Swaroop Mishra, Matthew Finlayson|arXiv (Cornell University)|2022. 10. 31.
Topic Modeling인용 수 4
한 줄 요약

Līla는 수학적 추론을 위한 통합 벤치마크로, 네 가지 차원—수학적 능력, 언어 형식, 언어 다양성, 외부 지식—에 걸쳐 23개의 과제를 포함하며, 실행 가능한 파이썬 프로그램 해법을 갖춘 100,000개 이상의 예제를 포함한다. 이 벤치마크는 추론 체인, 일반화 및 견고성의 평가를 가능하게 하며, 제안된 Bhāskara 모델은 60.40%의 F1 스코어를 기록했으며, 다중 과제 학습을 통해 단일 과제 모델 대비 21.83% 상대적인 F1 향상을 달성했다.

ABSTRACT

Mathematical reasoning skills are essential for general-purpose intelligent systems to perform tasks from grocery shopping to climate modeling. Towards evaluating and improving AI systems in this domain, we propose LILA, a unified mathematical reasoning benchmark consisting of 23 diverse tasks along four dimensions: (i) mathematical abilities e.g., arithmetic, calculus (ii) language format e.g., question-answering, fill-in-the-blanks (iii) language diversity e.g., no language, simple language (iv) external knowledge e.g., commonsense, physics. We construct our benchmark by extending 20 datasets benchmark by collecting task instructions and solutions in the form of Python programs, thereby obtaining explainable solutions in addition to the correct answer. We additionally introduce two evaluation datasets to measure out-of-distribution performance and robustness to language perturbation. Finally, we introduce BHASKARA, a general-purpose mathematical reasoning model trained on LILA. Importantly, we find that multi-tasking leads to significant improvements (average relative improvement of 21.83% F1 score vs. single-task models), while the best performing model only obtains 60.40%, indicating the room for improvement in general mathematical reasoning and understanding.

연구 동기 및 목표

  • 다양한 수학 주제, 문제 형식, 언어 스타일을 아우르는 AI 시스템의 수학적 추론 평가를 위한 통합적 벤치마크 부족 문제를 해결하기 위해.
  • 다양한 수학적 추론 데이터셋을 통합하여 도메인 특화 언어(DSL) 및 지침 기반 학습을 위한 지침 애너테이션을 추가함으로써 실행 가능한 파이썬 프로그램 해법을 포함하도록 확장하기 위해.
  • 전용 분포 외(OOD) 및 교란(Robustness) 분할을 통해 모델의 일반화 및 견고성 평가를 가능하게 하기 위해.
  • 이를 바탕으로 통합된 벤치마크에서 일반 목적의 수학적 추론 모델 Bhāskara를 훈련하고 평가하여 현재 AI 능력의 격차를 파악하기 위해.

제안 방법

  • 기존 20개의 수학적 추론 데이터셋에 파이썬 프로그램 애너테이션을 추가하여 추론 체인을 제공하고, 해법의 실행 가능성을 검증할 수 있도록 함.
  • 도메인 특화 언어(DSL)에서 자동 변환 및 수동 전문가 애너테이션을 활용하여 DSL이 제공되지 않는 경우 프로그램 해법을 생성함.
  • 각 예제를 네 가지 차원으로 분류함: 수학적 능력(예: 산술, 미적분), 언어 형식(예: 질의응답, 빈칸 채우기), 언어 다양성(언어 없음, 간단, 복잡), 외부 지식(일상지식, 물리학 등).
  • 두 가지 평가 분할을 도입함: Līla-OOD는 분포 외 일반화를 위한 것이고, Līla-Robust는 언어적 교란(예: 음성 변화)을 테스트하기 위한 것임.
  • 다중 과제 학습을 통해 추론 일반화를 향상시키기 위해 전체 Līla 벤치마크에서 일반 목적의 모델 Bhāskara를 훈련함.
  • 정답 기준으로 실행 가능한 프로그램을 사용하여 모든 테스트, OOD 및 견고성 분할에서 F1 스코어로 모델을 평가함.

실험 결과

연구 질문

  • RQ1다양한 수학적 추론 과제를 통합한 통합 벤치마크가 좁은, 과제 중심의 데이터셋을 초월해 AI 시스템의 평가를 향상시킬 수 있는가?
  • RQ2통합 벤치마크에서 다중 과제 학습이 단일 과제 미세조정 대비 수학적 추론 성능을 얼마나 향상시키는가?
  • RQ3유사한 기초 수학 능력을 요구하지만 어조나 형식이 다른 분포 외 예제에 대해 최신 모델의 일반화 능력은 어느 정도인가?
  • RQ4문제 서술에서 주동사/피동사 전환 또는 동의어 치환과 같은 언어적 교란에 대해 현재 모델의 견고성은 어느 정도인가?
  • RQ5실행 가능한 프로그램 애너테이션을 갖춘 종합적인 수학적 추론 벤치마크에서 현재 모델의 성능 한계는 무엇인가?

주요 결과

  • Bhāskara 모델은 Līla 벤치마크에서 60.40%의 F1 스코어를 기록하여 일반 수학적 추론 능력 향상 여건이 여전히 크다는 것을 시사한다.
  • 다중 과제 학습은 단일 과제 모델 대비 F1 스코어를 21.83% 상대적으로 향상시키며, 다양한 수학 과제 간 공동 학습의 이점이 입증된다.
  • Codex는 대부분의 데이터셋에서 다른 벤치마크보다 뛰어난 성능을 보이며 평균 F1 스코어 61.3%를 기록했고, 그 다음으로 GPT-3 및 미세조정된 GPT-Neo 모델이 뒤를 이었다.
  • 모델들은 단순하고 구조화된 문제(예: singleop, multiarith)에 대해 강력한 성능를 보이지만, 복잡하고 자연어 기반 문제(예: mathqa_geometry, svamp_structured)에서는 언어가 복잡하거나 모호할 경우 어려움을 겪는다.
  • Līla-OOD 및 Līla-Robust 분할은 모델들이 다른 어휘적 표현이나 언어적 변형에 대해 일반화 능력이 떨어지는 것으로 드러내며, 현재 추론 일반화의 핵심적 한계를 보여준다.
  • 실행 가능한 프로그램 해법의 포함은 추론 체인의 정확한 평가를 가능하게 하며, 모델들이 종종 잘못되거나 잘못된 추론 경로를 통해 정답을 도출한다는 것을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.