Skip to main content
QUICK REVIEW

[논문 리뷰] L2CEval: Evaluating Language-to-Code Generation Capabilities of Large Language Models

Ansong Ni, Pengcheng Yin|arXiv (Cornell University)|2023. 09. 29.
Natural Language Processing TechniquesComputer Science인용 수 3
한 줄 요약

L2CEval는 대규모 언어 모델(Large Language Models, LLMs)에서 언어-to-코드(L2C) 생성을 평가하기 위한 종합적이고 표준화된 벤치마크를 제시한다. 이 연구는 7개의 작업(의미 분석, 수학 추론, 파이썬 프로그래밍 포함)을 통해 총 54개의 모델을 평가하며, 모델 성능, 내성적 안정성, 신뢰도 校정, 실패 유형을 분석한다. 주요 영향 요인으로는 모델 크기, 사전학습 데이터, 지시 테이닝, 프롬프팅 전략을 규명하며, 향후 연구를 위해 모든 모델 출력물을 공개한다.

ABSTRACT

Recently, large language models (LLMs), especially those that are pretrained on code, have demonstrated strong capabilities in generating programs from natural language inputs in a few-shot or even zero-shot manner. Despite promising results, there is a notable lack of a comprehensive evaluation of these models language-to-code generation capabilities. Existing studies often focus on specific tasks, model architectures, or learning paradigms, leading to a fragmented understanding of the overall landscape. In this work, we present L2CEval, a systematic evaluation of the language-to-code generation capabilities of LLMs on 7 tasks across the domain spectrum of semantic parsing, math reasoning and Python programming, analyzing the factors that potentially affect their performance, such as model size, pretraining data, instruction tuning, and different prompting methods. In addition to assessing model performance, we measure confidence calibration for the models and conduct human evaluations of the output programs. This enables us to identify and analyze the typical failure modes across various tasks and models. L2CEval offers a comprehensive understanding of the capabilities and limitations of LLMs in language-to-code generation. We also release the evaluation framework and all model outputs, hoping to lay the groundwork for further future research in this domain.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)에서 언어-to-코드(L2C) 생성에 대한 체계적이고 표준화된 평가 프레임워크의 부재를 해결하기 위해.
  • 다양한 작업에서 모델 크기, 사전학습 데이터 혼합 비율, 지시 테이닝, 프롬프팅 방법의 영향을 L2C 성능에 미치는 영향을 평가하기 위해.
  • 모델의 내성적 안정성과 신뢰도 校정 수준을 측정하여, 다양한 모델 능력 수준에서 공통적으로 나타나는 실패 유형을 규명하기 위해.
  • 13개 기관에서 개발한 총 54개 모델를 대상으로 일관된 프롬프트와 평가 지표를 제공하는 종합적이고 재현 가능한 벤치마크를 제공하여 공정한 비교를 가능하게 하기 위해.
  • 모든 모델 출력물과 평가 프레임워크를 공개하여 향후 L2C 생성 분야의 연구를 가속화하기 위해.

제안 방법

  • 7개의 L2C 작업(2개의 의미 분석: Spider, WikiTQ; 2개의 수학 추론: GSM8K, SVAMP; 3개의 파이썬 프로그래밍: MBPP, HumanEval, DS-1000)에서 일관된 프롬프트와 평가 지표를 사용한 표준화된 평가 프rotocol.
  • 13개 기관에서 개발한 총 54개의 LLM을 평가하며, 개방형 및 비개방형 모델을 포함하며, 파arameter 수는 1B에서 170B+에 이르는 범위를 포함.
  • 모델 크기와 사전학습 데이터(35B에서 1T 토큰)에 대한 스케일링 법칙을 체계적으로 분석하여, 다양한 작업에서의 성능 향상 정도를 측정.
  • 소수 샘플, 제로샷, 지시 테이닝 프롬프팅 전략 간의 비교를 통해 각 전략이 생성 품질에 미치는 영향을 평가.
  • 로그릿과 예측 신뢰도 점수를 활용한 신뢰도 校정 분석을 통해 모델의 신뢰성 수준을 평가.
  • 자동 평가 지표의 타당성을 검증하고 질적 실패 패tern을 규명하기 위해 인간 평가를 통해 모델 출력물을 검토.

실험 결과

연구 질문

  • RQ1다양한 언어-to-코드 작업에서 모델 크기와 사전학습 데이터 크기의 성능에 대한 스케일링 법칙은 어떻게 나타나는가?
  • RQ2지시 테이닝과 다양한 프롬프팅 전략(제로샷 대비 소수 샘플)이 L2C 생성 품질에 미치는 상대적 영향은 무엇인가?
  • RQ3LLM의 예측 신뢰도 점수가 정확한 코드 생성에서 얼마나 잘 校정되어 있으며, 이는 모델 유형과 작업 유형에 따라 어떻게 달라지는가?
  • RQ4LLM 생성 코드에서 가장 흔한 실패 유형은 무엇이며, 이는 모델 능력 수준과 작업 유형에 따라 어떻게 다를까?
  • RQ5자동 평가 지표가 코드 정확성과 품질에 대한 인간 평가와 얼마나 상관이 있는가?

주요 결과

  • 모델 크기가 클수록 모든 L2C 작업에서 일관되게 더 높은 성능를 보이며, 모델 크기와 사전학습 데이터 크기에 따라 예측 가능한 스케일링 법칙이 적용된다.
  • 지시 테이닝은 특히 복잡한 추론 및 코드 생성 작업에서 제로샷 및 소수 샘플 전략의 성능을 크게 향상시킨다.
  • 신뢰도 校정 수준은 다양하게 나타나며, 더 큰 모델과 지시 테이닝을 거친 모델은 잘못된 출력에 대해 과도하게 자신감을 갖는 것을 줄이는 등 보다 우수한 校정 수준을 보인다.
  • 흔한 실패 유형으로는 잘못된 산술 계산, 문제 제약 조건의 오해, 제어 흐름에서의 논리 오류가 있으며, 특히 수학 추론과 의미 분석 작업에서 두드러진다.
  • 정확도 일치(Match)와 pass@k와 같은 자동 평가 지표는 인간 평가와 중간 정도의 상관관계를 보이지만, 미세한 논리적 또는 문법적 오류를 포착하지 못한다.
  • 모든 모델 출력물(텍스트 및 로짓)의 공개는 향후 연구자가 실패 패턴을 분석하고 평가 지표를 개선하며, 코드 생성을 위한 더 견고한 LLM을 훈련하는 데 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.