Skip to main content
QUICK REVIEW

[논문 리뷰] TheoremQA: A Theorem-driven Question Answering dataset

Wenhu Chen, Ming Yin|arXiv (Cornell University)|2023. 05. 21.
Topic Modeling인용 수 5
한 줄 요약

TheoremQA는 과학·기술·공학·수학 분야의 350개 정리에 기반한 800개의 고품질 질문을 포함한, 정리 기반 질문-답변 데이터셋으로, LLM의 도메인 특화 정리 적용 능력을 평가하기 위해 설계되었다. GPT-4는 사고의 흐름 프롬프팅을 사용해 51%의 정확도를 기록했으며, 오픈소스 모델들은 15% 이하에 머물러 있어 뚜렷한 성능 격차가 드러나며 정리 인식 기반 미리 훈련의 필요성을 시사한다.

ABSTRACT

The recent LLMs like GPT-4 and PaLM-2 have made tremendous progress in solving fundamental math problems like GSM8K by achieving over 90% accuracy. However, their capabilities to solve more challenging math problems which require domain-specific knowledge (i.e. theorem) have yet to be investigated. In this paper, we introduce TheoremQA, the first theorem-driven question-answering dataset designed to evaluate AI models' capabilities to apply theorems to solve challenging science problems. TheoremQA is curated by domain experts containing 800 high-quality questions covering 350 theorems (e.g. Taylor's theorem, Lagrange's theorem, Huffman coding, Quantum Theorem, Elasticity Theorem, etc) from Math, Physics, EE&CS, and Finance. We evaluate a wide spectrum of 16 large language and code models with different prompting strategies like Chain-of-Thoughts and Program-of-Thoughts. We found that GPT-4's capabilities to solve these problems are unparalleled, achieving an accuracy of 51% with Program-of-Thoughts Prompting. All the existing open-sourced models are below 15%, barely surpassing the random-guess baseline. Given the diversity and broad coverage of TheoremQA, we believe it can be used as a better benchmark to evaluate LLMs' capabilities to solve challenging science problems. The data and code are released in https://github.com/wenhuchen/TheoremQA.

연구 동기 및 목표

  • 복잡한, 정리에 의존하는 과학 문제를 평가할 수 있는 벤치마크의 부족을 해결하기 위해.
  • 수학, 물리학, 전기공학 및 컴퓨터과학, 금융 분야를 아우르는 800개의 질문-정리-답안 삼중세트로 구성된 고품질 전문가 검증 데이터셋을 구축하기 위해.
  • 사고의 흐름과 사고의 프로그램을 활용한 프롬프팅 기법을 적용해 다양한 대규모 언어 및 코드 모델의 정리 기반 추론 성능을 평가하기 위해.
  • LLM 출력에서 발생하는 고장 유형과 오류 패tern을 분석하여, 특히 정리 재현, 공식 적용, 계산 오류와 같은 문제를 규명하기 위해.
  • 도표를 포함한 다중모달 과학 문제의 과제를 탐색하고, 시각 인식 기반 LLM의 성능을 평가하기 위해.

제안 방법

  • 데이터셋은 두 단계로 구성되었다: 첫째, 과학·기술·공학·수학 분야의 400개 정리를 도출하였고, 둘째, 도메인 전문가들이 교과서와 인터넷 자료에서 질문을 수집하고 정제하여 답변 형식의 일관성을 확보하였다.
  • 질문은 타일러 정리, 라그랑주 정리, 양자 정리와 같은 특정 정리를 적용할 수 있도록 구성되어, 도메인 특화 추론이 필수적인 문제임을 보장하였다.
  • GPT-4, Claude, LLaMA, CodeGen, StarCoder 등 16종의 다양한 지시 프롬프팅에 최적화된 언어 및 코드 모델을 평가하였다.
  • 사고의 흐름(CoT)과 사고의 프로그램(PoT)이라는 두 가지 프롬프팅 전략을 적용하여 추론의 효율성과 정확도를 평가하였다.
  • 모델 성능 향상을 위해 관련 정리를 입력 프롬프트에 명시적으로 포함시키는 정리 통합 기법을 탐색하였다.
  • 텍스트와 도표를 조합하여 다중모달 질문을 생성하였고, 시각 인식 기반 인코더(Clip, BLIP) 유무에 따라 모델 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1최신 LLM은 도메인 특화 지식이 요구되는 정리 기반 과학 문제에서 얼마나 잘 수행되는가?
  • RQ2사고의 흐름 대비 사고의 프로그램 프롬프팅이 추론 정확도와 출력 안정성 향상에 기여하는가?
  • RQ3LLM이 정리 기반 문제를 해결할 때 발생하는 주요 고장 유형은 무엇이며, 모델 간에 어떻게 다를까?
  • RQ4시각 인식 기반 인코더는 도표를 포함한 다중모달 과학 문제에서 성능 향상에 얼마나 기여하는가?
  • RQ5오픈소스 LLM은 과학 전용 데이터로의 훈련 없이도 정리 기반 추론에서 경쟁 가능한 성능을 낼 수 있는가?

주요 결과

  • GPT-4는 사고의 프로그램 프롬프팅을 사용해 TheoremQA에서 51%의 정확도를 기록했으며, 다른 모든 모델보다 뚜렷하게 뛰어난 성능을 보였다.
  • 두 번째로 높은 성능을 기록한 모델인 ChatGPT도 동일한 프롬프팅 방식을 사용해 35%의 정확도를 기록했으며, 이는 GPT-4와의 뚜렷한 성능 격차를 시사한다.
  • GPT-4의 오류의 절반은 미세한 계산 또는 반올림 오류였으며, 이는 향상된 프롬프팅 기법이나 인간 간섭을 통해 나머지 정확도 격차의 대부분을 보완할 수 있음을 시사한다.
  • 테스트된 모든 오픈소스 모델은 15% 이하의 정확도를 기록하여 무작위 추측을 약간 넘어서지 못했으며, 이는 정리 인식 기반 미리 훈련 또는 파인튜닝의 절실한 필요성을 보여준다.
  • 시각 인식 기반 LLM인 LLaVA와 VisualGLM는 텍스트 전용 모델인 Alpaca와 비교해 유의미한 성능 향상을 보이지 않아 현재의 시각 인코더가 도표 기반 과학 문제에 대해 충분하지 않음을 시사한다.
  • 오류 분석 결과, Alpaca의 주요 고장 유형은 정리를 모른다는 점(E1)이었고, GPT-4의 오류는 주로 미세한 계산 오류(E3)였으며, 이는 다양한 모델 간 고장 프로파일이 다름을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.