Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple-Choice Questions are Efficient and Robust LLM Evaluators

Ziyin Zhang, Zhaokun Jiang|arXiv (Cornell University)|2024. 05. 20.
Customer churn and segmentationBusiness, Management and Accounting인용 수 3
한 줄 요약

이 논문은 GSM8K와 MATH와 같은 개방형 LLM 평가 벤치마크를 50여 개의 오픈소스 모델에서 올바른 답변과 잘못된 예측을 수집하여 강력한 오답 선택지를 생성함으로써 다중선택지(MC) 형식인 GSM-MC와 MATH-MC로 변환하는 방법을 제안한다. 이 방법은 모델 로짓을 통해 효율적이고 정확한 평가를 가능하게 하여 평가 시간을 최대 30배 단축시키며, 다양한 오답 선택지와 선택지 순서 변화에도 불구하고 원래의 벤치마크 성능과 높은 상관관계(r > 0.9)를 유지한다.

ABSTRACT

We present GSM-MC, a multiple-choice (MC) dataset constructed by collecting answers and incorrect predictions on GSM8K from 60 open-source models. Through extensive experiments, we show that LLMs' performance on the MC version of this popular benchmark is strongly correlated with their performance on the original version and is quite robust to distractor choices and option orders, while the evaluation time is reduced by a factor of up to 30. Following similar procedures, we introduce MATH-MC, constructed from MATH, and PythonIO, a new program reasoning MC dataset constructed from HumanEval and MBPP. Experimental results indicate that LLMs' performance on these MC benchmarks leaves much room for improvement. Our data and code are available at https://github.com/Geralt-Targaryen/MC-Evaluation.

연구 동기 및 목표

  • GSM8K와 MATH와 같은 개방형 벤치마크에서 잘못된 또는 형식이 잘못된 답변이 발생하는 문제를 해결한다.
  • 모델 생성 결과에서 수동으로 추출하는 히ュ리스틱 기반의 답변 추출 과정에서 발생하는 평가 시간과 잘못된 음성 결과를 줄인다.
  • 모델 예측에서 수집한 정제된 오답 선택지를 활용한 다중선택지 형식을 통해 LLM 평가의 강건성을 향상시킨다.
  • 프로그래밍 출력 예측 작업(PythonIO)을 도입하여 다중선택지 평가 패러다임을 코드 생성 벤치마크인 HumanEval과 MBPP로 확장한다.
  • 다중선택지 평가가 기존의 개방형 평가 방식에 비해 신뢰성 있고 효율적이며 강건한 대안임을 입증한다.

제안 방법

  • GSM8K와 MATH에서 50여 개 이상의 오픈소스 LLM으로부터 정답과 잘못된 예측을 추출하여 GSM-MC와 MATH-MC를 구성한다.
  • 모델이 생성한 잘못된 답변을 오답 선택지로 활용하여 의미적으로 타당한 선택지를 구성한다.
  • 원래 문제를 4~8개의 선택지를 가진 다중선택지 형식으로 재구성하며, 일관된 구조와 답변 형식을 유지한다.
  • HumanEval과 MBPP를 프로그래밍 출력 예측 작업으로 변환하여 PythonIO를 개발한다. 이 경우 모델은 여러 선택지 중 정답 출력을 선택한다.
  • 모델 로짓에서 직접 예측을 추출하여 텍스트 파싱 과정에서 발생하는 오류를 방지함으로써 MC 형식의 평가를 수행한다.
  • 다양한 선택지 수, 오답 선택지 세트, 선택지 순서의 순열을 고려한 체계적 아블레이션 연구를 수행하여 강건성을 테스트한다.

실험 결과

연구 질문

  • RQ1GSM8K와 MATH와 같은 개방형 벤치마크를 다중선택지 형식으로 변환하는 것이 원래의 벤치마크와의 모델 성능 상관관계를 유지할 수 있는가?
  • RQ2오답 선택지의 품질과 선택지 순서의 변화에 대해 다중선택지 평가는 얼마나 강건한가?
  • RQ3기존의 개방형 생성 방식에 비해 다중선택지 평가는 평가 시간을 얼마나 줄일 수 있는가?
  • RQ4다중선택지 평가 패러다임은 HumanEval과 MBPP와 같은 코드 생성 벤치마크로 효과적으로 확장될 수 있는가?
  • RQ5다중선택지 평가는 형식이 잘못되거나 무효한 모델 출력으로 인한 잘못된 음성 결과를 완화할 수 있는가?

주요 결과

  • 모든 테스트된 모델 크기와 설정에서 GSM-MC와 MATH-MC에서의 LLM 성능은 원래의 GSM8K와 MATH 벤치마크 성능과 강한 상관관계(r > 0.9)를 보인다.
  • 다중선택지 평가는 오답 선택지의 변동성과 선택지 순서 변화에 대해 강건하며, 다른 모델의 예측으로 오답 선택지를 교체하더라도 성능 안정성이 유지된다.
  • 모델 로짓에서 직접 예측을 추출함으로써 생성된 텍스트를 파싱하는 과정을 피함으로써 평가 시간이 최대 30배 단축된다.
  • 제안된 PythonIO 데이터셋은 코드 생성 모델의 평가를 다중선택지 형식으로 효율적이고 정확하게 수행할 수 있게 하며, 코드 생성 과정에서 발생하는 파싱 오류를 방지한다.
  • 지시 미세조정된 모델은 개방형 형식에서 훨씬 더 많은 무효한 답변을 생성하지만, 다중선택지 변환을 통해 출력 형식을 표준화함으로써 이 문제를 완화한다.
  • 선택지 수가 2개일 경우조차도 높은 평가 정밀도를 유지함으로써 다양한 다중선택지 구성에 대해 이론적 타당성과 확장 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.