Skip to main content
QUICK REVIEW

[논문 리뷰] NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks

Swaroop Mishra, Arindam Mitra|arXiv (Cornell University)|2022. 04. 12.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 AI 시스템이 다양한 포맷에서 정확하고 포맷에 종속되지 않는 수치적 추론를 수행할 수 있는 능력을 평가하기 위해 설계된 여덟 가지 산술 추론 작업(네 가지 신규 및 네 가지 기존)으로 구성된 다중 작업 벤치마크인 NumGLUE를 소개한다. 최신 기술 모델인 피인-튜닝된 GPT-3-13B조차도 인간 수준에 비해 성능이 크게 뒤처지며(46.4% 낮음), 작업 간 공동 학습은 평균 3.4% 향상을 이끌어내어 자연어처리(NLP) 분야에서 일반화 가능한 산술 추론의 필요성을 입증한다.

ABSTRACT

Given the ubiquitous nature of numbers in text, reasoning with numbers to perform simple calculations is an important skill of AI systems. While many datasets and models have been developed to this end, state-of-the-art AI systems are brittle; failing to perform the underlying mathematical reasoning when they appear in a slightly different scenario. Drawing inspiration from GLUE that was proposed in the context of natural language understanding, we propose NumGLUE, a multi-task benchmark that evaluates the performance of AI systems on eight different tasks, that at their core require simple arithmetic understanding. We show that this benchmark is far from being solved with neural models including state-of-the-art large-scale language models performing significantly worse than humans (lower by 46.4%). Further, NumGLUE promotes sharing knowledge across tasks, especially those with limited training data as evidenced by the superior performance (average gain of 3.4% on each task) when a model is jointly trained on all the tasks as opposed to task-specific modeling. Finally, we hope that NumGLUE will encourage systems that perform robust and general arithmetic reasoning within language, a first step towards being able to perform more complex mathematical reasoning.

연구 동기 및 목표

  • 질문 형식이 변화할 경우 현재 AI 시스템의 산술 추론 능력이 취약해지는 문제를 해결하기 위해.
  • 다양한 수치적 추론 형식 간의 일반화 능력을 평가할 수 있는 다중 작업 벤치마크를 개발하기 위해.
  • GPT-3와 같은 최신 기술 모델이 다양한 언어적 맥락에서 수치를 다룰 때 근본적인 한계를 규명하기 위해.
  • 다양한 작업 간 공동 학습이 지식 전이를 통해 성능 향상에 기여함을 입증하기 위해, 특히 데이터가 적은 작업에서의 성능 향상을 중심으로.
  • 복잡한 수학적 추론의 기초가 되는 일반화 가능하고 포맷에 종속되지 않는 수치적 추론을 향한 연구를 촉진하기 위해.

제안 방법

  • 산술 추론의 핵심을 요구하는 여덟 가지 다른 작업(신규 네 개 포함)을 포함한 다중 작업 벤치마크를 설계한다.
  • 작업들 간의 다양성을 확보하면서도 산술 복잡도를 유지하기 위해, 약 10만 개의 문제를 수집하며, 형식의 다양성(예: 단어 문제, 빈칸 채우기, NLI, 비교)을 확보한다.
  • 메모리 증강 신경망 모델(Ex-NumNet)과 피인-튜닝된 GPT-3를 포함한 여러 베이스라인을 태스크별 및 다중 작업 학습 설정에서 훈련 및 평가한다.
  • 지식 의존 작업에서 추론 성능을 향상시키기 위해 조건부 정보 검색(CIR) 모듈을 구현한다.
  • 작업 간 데이터 불균형을 완화하기 위해 오버샘플링을 적용하고, 다중 작업 학습과의 영향을 비교한다.
  • 각 태스크당 50개 샘플을 대상으로 오류 분석을 수행하여 실패 유형을 분류: 잘못된 출력, 수치 복사, 잘못된 계산, 중복된 텍스트 생성.

실험 결과

연구 질문

  • RQ1AI 모델은 단어 문제, 빈칸 채우기, NLI, 비교 작업 등 다양한 질문 형식 간에 산술 추론을 일반화할 수 있는가?
  • RQ2질문 형식이 변화할 경우, 최신 기술 대규모 언어 모델인 GPT-3는 단순한 산술 추론에서 얼마나 실패하는가?
  • RQ3다양한 산술 작업 간 공동 다중 작업 학습은 태스크별 피인-튜닝보다 성능 향상과 지식 전이를 이끌어내는가?
  • RQ4엔드 투 엔드(GPT-3 등)와 뉴로-심볼릭(Ex-NumNet 등)의 다양한 모델링 철학 간의 성능 및 내성적 안정성은 어떻게 비교되는가?
  • RQ5현재 모델에서 지배적인 오류 유형은 무엇이며, 아키텍처나 훈련 개선을 통해 이를 완화할 수 있는가?

주요 결과

  • 최신 기술 대규모 언어 모델, 특히 피인-튜닝된 GPT-3-13B는 NumGLUE 태스크 전체에서 인간 수준보다 평균 46.4% 낮은 성능을 보이며, 산술 추론 일반화 능력에 근본적인 격차가 있음을 시사한다.
  • 모든 여덟 개 태스크 간 공동 학습은 태스크별 학습 대비 평균 각 태스크당 3.4% 향상된 성능을 기록하여 효과적인 지식 전이를 입증한다.
  • GPT-3-13B는 외부 지식이 필요한 태스크에서 다른 베이스라인보다 뛰어난 성능을 보이며, 넓은 웹 스케일 코퍼스에서의 사전 훈련 덕분일 것이다.
  • 가장 흔한 오류 유형은 잘못된 계산(Ex-NumNet의 경우 71%, GPT-3의 경우 56%)이며, 이어 잘못된 출력과 중복된 텍스트 생성이 뒤를 이룬다.
  • 오버샘플링은 데이터가 적은 태스크에서 성능 향상을 이끌지만, 데이터가 많은 태스크에서는 성능을 떨어뜨리며, 조건부 정보 검색을 갖춘 다중 작업 베이스라인을 항상 뛰어나지 못한다.
  • 오류 분석 결과, 모델들은 종종 정답을 계산하는 대신 수치를 그대로 복사하는 경향이 있으며, GPT-3는 Ex-NumNet보다 훨씬 더 많은 중복된 텍스트를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.