Skip to main content
QUICK REVIEW

[논문 리뷰] Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language Models

Daman Arora, Himanshu Singh|arXiv (Cornell University)|2023. 05. 24.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 IIT JEE-Advanced 시험에서 유래한 515개의 사전설계된 물리, 화학, 수학 문제로 구성된 도전적인 벤치마크인 JEEBench를 소개한다. 이는 장기적 추론와 깊이 있는 영역 지식을 테스트하기 위해 설계되었다. 체인 오브 쓰로트(Chain-of-Thought)와 자기일致성(Self-Consistency)와 같은 고급 프롬프팅 기법을 적용해도 GPT-4는 2023년 테스트 세트에서 단지 33.8%의 점수를 기록했다. 후행적으로 신뢰도 임계값 기반 처리를 적용한 후에야 인간 스코어의 상위 10~20% 수준으로 성능이 향상되었으며, 이는 대수적 연산, 개념 검색, 위험 평가 등 핵심적인 격차를 드러낸다.

ABSTRACT

The performance of large language models (LLMs) on existing reasoning benchmarks has significantly improved over the past years. In response, we present JEEBench, a considerably more challenging benchmark dataset for evaluating the problem solving abilities of LLMs. We curate 515 challenging pre-engineering mathematics, physics and chemistry problems from the highly competitive IIT JEE-Advanced exam. Long-horizon reasoning on top of deep in-domain knowledge is essential for solving problems in this benchmark. Our evaluation on various open-source and proprietary models reveals that the highest performance, even after using techniques like self-consistency, self-refinement and chain-of-thought prompting, is less than 40%. The typical failure modes of GPT-4, the best model, are errors in algebraic manipulation, difficulty in grounding abstract concepts into mathematical equations accurately and failure in retrieving relevant domain-specific concepts. We also observe that by mere prompting, GPT-4 is unable to assess risk introduced by negative marking for incorrect answers. For this, we develop a post-hoc confidence-thresholding method over self-consistency, which enables effective response selection. We hope that our challenging benchmark will guide future re-search in problem-solving using LLMs.

연구 동기 및 목표

  • 기존의 추론 데이터셋을 넘어서 LLM의 문제 해결 능력을 평가하기 위한 엄격한 벤치마크를 개발하기 위해.
  • 특히 GPT-4와 같은 최신 LLM이 과학, 기술, 공학 및 수학 분야의 깊이 있는 영역 지식과 장기적 추론이 요구되는 고난이도 다단계 문제를 해결하는 데서 보이는 한계를 평가하기 위해.
  • 특히 음수 마킹이 적용되는 환경에서 대수적 연산, 개념 검색, 위험 인식 의사결정에 있어 LLM 추론의 실패 원인을 분석하기 위해.
  • 자기일치성 출력을 기반으로 한 후행적 신뢰도 임계값 처리 방법을 제안하고 평가하기 위해.
  • 미래의 추론 능력을 갖춘 LLM 연구를 이끄는 데 유용한 신뢰할 수 있고 오염이 통제된 데이터셋을 제공하기 위해.

제안 방법

  • IIT JEE-Advanced 시험의 8개 회차에서 유래한 515개의 도전적인 문제를 선별하여, 다단계 추론과 영역 전문 지식이 요구되는 물리, 화학, 수학 문제에 집중했다.
  • 추론의 강건성을 향상시키기 위해 각 문제에 대해 체인 오브 쓰로트(Chain-of-Thought, CoT) 프롬프팅과 자기일치성(Self-Consistency, SC)을 적용하여 다수의 추론 경로를 생성했다.
  • 자기일치성 출력에 대해 후행적으로 신뢰도 임계값 처리 방법을 구현하였으며, 예측된 답의 상대 빈도를 신뢰도의 대체 지표로 사용했다.
  • 오픈소스 및 프라이빗 LLM을 대상으로 광범위한 정량적 및 정성적 분석을 수행하여 이 벤치마크에서의 성능을 평가했다.
  • 공개 코퍼스에서 문제 인스턴스를 검색하여 오염도를 분석하고, 2023년 문제에 대해 모델 성능을 평가하여 오염되지 않은 것으로 판단된 데이터셋을 확보했다.
  • 성능 정규화를 위해 인간 성능을 추정하여 2023년 시험의 인간 기준과 LLM 성능을 비교 분석했다.

실험 결과

연구 질문

  • RQ1현재의 LLM, 특히 GPT-4는 깊이 있는 도메인 지식과 장기적 추론이 요구되는 고난이도 다단계 STEM 문제를 신뢰성 있게 해결할 수 있는가?
  • RQ2최신 LLM의 복잡한 문제 해결에서의 주요 실패 원인은 무엇인가? 특히 대수적 연산과 개념 검색에서의 실패 원인은 무엇인가?
  • RQ3자기일치성과 자기개선 기법은 이 벤치마크에서 추론 성능 향상에 얼마나 효과적인가?
  • RQ4간단한 후행적 신뢰도 임계값 처리 방법은 음수 마킹이 적용되는 시험 유사 환경에서 LLM 성능 향상에 기여하는가?
  • RQ5JEEBench 데이터셋은 사전 훈련 데이터에 노출되어 얼마나 오염되었으며, 이는 모델 성능 평가에 영향을 미치는가?

주요 결과

  • GPT-4는 체인 오브 쓰로트와 자기일치성 프롬프팅을 사용하여 2023년 IIT JEE-Advanced 테스트 세트에서 33.8%의 점수를 기록하여 추론의 강건성에 한계가 있음을 시사한다.
  • 자기일치성 출력에 대해 신뢰도 임계값 처리를 적용한 후, GPT-4의 성능은 2023년 시험에서 인간 스코어 상위 10~20% 수준으로 향상되었다.
  • 모든 평가된 모델 중에서 최고 성능조차도 40% 이하에 머물러 있어 LLM 추론 능력 향상에 지속적인 과제가 있음을 보여준다.
  • GPT-4는 일부 경우에서 강력한 논리적 추론 능력을 보였지만, 대수적 연산과 개념 검색에서 빈번히 실패했다.
  • 시험 환경에서 음수 마킹을 고려하지 못해 성능이 저하되었으며, 마킹 체계를 프롬프팅으로 제공한 후 성능 저하가 발생했다.
  • 데이터셋 오염도는 약 6%로 추정되어, GPT-4의 성능는 기억력이 아닌 추론 능력의 진정한 지표로 간주될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.