Skip to main content
QUICK REVIEW

[논문 리뷰] SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research

Liangtai Sun, Yang Han|arXiv (Cornell University)|2023. 08. 25.
Topic Modeling인용 수 5
한 줄 요약

SciEval는 화학, 물리학, 생물학 분야의 객관적이고 주관적인 질문을 통합하여 대규모 언어 모델(LM)의 과학적 추론 능력을 평가하기 위한 종합적이고 다층적인 벤치마크이다. 데이터 유출을 방지하기 위해 동적 데이터 생성 기법을 도입하였으며, 기본 지식, 지식 적용, 과학 계산, 연구 능력의 네 가지 차원에서 LLM을 평가하여 GPT-4가 선도하고 있음에도 불구하고 특히 동적 및 실험적 추론 과제에서 여전히 큰 격차가 존재하는 것으로 드러났다.

ABSTRACT

Recently, there has been growing interest in using Large Language Models (LLMs) for scientific research. Numerous benchmarks have been proposed to evaluate the ability of LLMs for scientific research. However, current benchmarks are mostly based on pre-collected objective questions. This design suffers from data leakage problem and lacks the evaluation of subjective Q/A ability. In this paper, we propose SciEval, a comprehensive and multi-disciplinary evaluation benchmark to address these issues. Based on Bloom's taxonomy, SciEval covers four dimensions to systematically evaluate scientific research ability. In particular, we design a "dynamic" subset based on scientific principles to prevent evaluation from potential data leakage. Both objective and subjective questions are included in SciEval. These characteristics make SciEval a more effective benchmark for scientific research ability evaluation of LLMs. Comprehensive experiments on most advanced LLMs show that, although GPT-4 achieves SOTA performance compared to other LLMs, there is still substantial room for improvement, especially for dynamic questions. The codes and data are publicly available on https://github.com/OpenDFM/SciEval.

연구 동기 및 목표

  • 기존 벤치마크가 정적 객관적 질문에만 의존하고 데이터 유출 문제를 겪는다는 한계를 해결하기 위해.
  • LLM의 과학적 추론 능력 전반을 포괄적으로 평가할 수 있는 종합적 평가 프레임워크를 개발하기 위해.
  • 실험 설계 및 결과 해석과 같은 주관적 질문을 포함하여 고차원 과학적 사고 능력을 평가하기 위해.
  • 과학 원리를 바탕으로 한 실시간 동적 데이터 생성을 통해 데이터 유출 위험을 최소화하기 위해.
  • 현실 세계의 과학 연구 시나리오에서 최신 LLM을 평가하기 위한 표준화된 다학문적 벤치마크를 제공하기 위해.

제안 방법

  • SciEval는 블룸의 브런치니즘을 기반으로 하여 기본 지식, 지식 적용, 과학 계산, 연구 능력의 네 가지 인지 차원에서 LLM을 평가한다.
  • 화학, 물리학, 생물학 분야에서 총 15,901道의 질문을 포함하며, 동적 및 정적 하위집합을 포함해 18,000개의 질문이 포함되어 있다.
  • 기억을 방지하고 평가의 공정성을 확보하기 위해 과학 원리를 기반으로 실시간으로 동적 데이터를 생성한다.
  • 실험 설계 및 결과 해석에 대한 주관적 추론을 포함하는 전용 '실험 데이터' 하위집합 12개의 실제 과학 실험을 포함한다.
  • 세 가지 설정에서 평가가 수행된다: 응답 전용, 사고의 사슬(CoT), 소수 샘플(3-샷), 이는 다양한 추론 전략 간 성능 비교를 가능하게 한다.
  • 정확도, BLEU 점수, 과학 계산 과제에 대해 평균 제곱오차(MSE)를 사용하여 성능를 측정하며, 분야 및 설정별로 결과를 분석한다.
Figure 1: The illustration of the evaluation system. SciEval covers three disciplines with amounts of sub-topics, and investigates four abilities, corresponding to six cognitive levels.
Figure 1: The illustration of the evaluation system. SciEval covers three disciplines with amounts of sub-topics, and investigates four abilities, corresponding to six cognitive levels.

실험 결과

연구 질문

  • RQ1최신 LLM은 객관적 및 주관적 질문을 모두 포함한 다층적·다학문적 과학 벤치마크에서 어떻게 성능을 내는가?
  • RQ2정적 사전 수집 과학 질문에 대해 평가받을 때 LLM은 어느 정도의 데이터 유출를 보이는가?
  • RQ3응답 전용, 사고의 사슬, 소수 샘플 전략과 같은 다양한 추론 전략은 과학적 추론 과제에서 LLM 성능에 어떤 영향을 미치는가?
  • RQ4기억을 방지할 수 있도록 원리 기반 동적 과학 질문에 대해 LLM은 얼마나 잘 일반화되는가?
  • RQ5특히 물리학 및 화학 분야에서 LLM은 과학 계산 및 실험 결과 분석 분야에서 어떤 구체적인 약점을 보이는가?

주요 결과

  • GPT-4는 모든 하위집합에서 최고 성능을 기록하며, 평균 정확도와 BLEU 점수 모두 가장 높은 수준을 보였으며, 특히 3-샷 설정에서 동적 데이터에 대해 51.01%의 정확도를 기록했다.
  • 강력한 성능에도 불구하고, GPT-4는 CoT 설정에서 물리 문제 해결 시 잘못된 공식을 자주 사용하여 정확도는 높지만 추론에 결함이 있음을 시사한다.
  • GPT-3.5-turbo 및 Claude-v1.3를 포함한 대부분의 LLM은 정적 데이터에서 60% 미만의 정확도를 기록하여 향후 개선 여지가 크다는 점을 확인했다.
  • 물리학 하위집합에서는 모든 모델이 동적 데이터에서 거의 랜덤 수준의 성능을 보였으며, 대부분의 경우 정확도가 25% 미만이었고, 이는 새로운 물리 문제에 대한 일반화 능력이 떨어짐을 의미한다.
  • Galactica-30B와 같은 모델은 과학 계산 과제에서 다른 모델보다 뛰어난 성능을 보였으며, 특히 화학 분야에서 도메인 특화 미리 훈련의 이점을 보여주었다.
  • 모든 모델은 실험 데이터 하위집합에서 실험 결과 분석에 크게 어려움을 겪었으며, 실험 설계 및 원리 이해에서는 비교적 양호한 성능를 보였음에도 불구하고.
Figure 2: Data Collection steps of Static Data
Figure 2: Data Collection steps of Static Data

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.