Skip to main content
QUICK REVIEW

[논문 리뷰] BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and Semantic Parsing

Subhro Roy, Sam Thomson|arXiv (Cornell University)|2022. 06. 21.
Topic Modeling인용 수 7
한 줄 요약

BenchCLAMP는 문맥 자유 문법을 통한 제약된 디코딩을 사용하여 문법적 및 의미적 구문 분석 작업에서 언어 모델을 평가하기 위한 벤치마크입니다. 이는 여덟 개의 모델 간에 신뢰할 수 있는 성능 비교를 가능하게 하며, 특히 자원이 제한된 환경에서 제약된 디코딩를 적용한 미세조정된 인코더-디코더 모델이 최신 기술 수준의 성능을 달성함을 보여줍니다.

ABSTRACT

Recent work has shown that generation from a prompted or fine-tuned language model can perform well at semantic parsing when the output is constrained to be a valid semantic representation. We introduce BenchCLAMP, a Benchmark to evaluate Constrained LAnguage Model Parsing, that includes context-free grammars for seven semantic parsing datasets and two syntactic parsing datasets with varied output representations, as well as a constrained decoding interface to generate only valid outputs covered by these grammars. We provide low, medium, and high resource splits for each dataset, allowing accurate comparison of various language models under different data regimes. Our benchmark supports evaluation of language models using prompt-based learning as well as fine-tuning. We benchmark eight language models, including two GPT-3 variants available only through an API. Our experiments show that encoder-decoder pretrained language models can achieve similar performance or surpass state-of-the-art methods for syntactic and semantic parsing when the model output is constrained to be valid.

연구 동기 및 목표

  • 구문 분석과 같은 구조 예측 작업에서 언어 모델에 대한 표준화된 평가의 부족을 해결하기 위해.
  • 재사용 가능한 문법과 제약된 디코딩 인터페이스를 제공하여 개발자가 구문 분석 작업에서 언어 모델을 평가하는 데 드는 장벽을 낮추기 위해.
  • 다양한 자원 수준에서 프롬프팅 기반 학습과 미세조정 간의 성능를 비교하기 위해.
  • 제약된 디코딩, 문맥 인코딩, 프롬프팅 엔지니어링이 구문 분석 정확도에 미치는 영향을 조사하기 위해.
  • 유효한 출력 생성을 위한 언어 모델을 사용한 문법적 및 의미적 구문 분석에서의 최선의 실천 방법을 수립하기 위해.

제안 방법

  • 일곱 개인 의미 구문 분석 및 두 개인 문법적 구문 분석 작업을 포함한 아홉 개인 구문 분석 데이터셋을 포함한 벤치마크를 설계하여, 유효한 출력 생성을 위한 문맥 자유 문법을 제공합니다.
  • 각 데이터셋에 대해 저자원, 중간자원, 고자원 분할을 제공하여 다양한 자원 수준에서의 성능 평가를 가능하게 합니다.
  • 제공된 문맥 자유 문법을 사용하여 문법적으로 유효한 출력만 생성되도록 보장하는 제약된 디코딩 인터페이스를 구현합니다.
  • 자기회귀적 모델과 시퀀스 투 시퀀스 모델의 디코딩 파이프라인에 문법을 통합하여 프롬프팅 기반 학습과 미세조정을 모두 지원합니다.
  • BM25와 문장 임베딩(예: SentenceT5-xxl)을 사용한 검색 기반 프롬프팅 엔지니어링을 통해 소수의 예제를 활용한 프롬프팅 성능을 향상시킵니다.
  • 의미적 및 문법적 구문 분석 작업에 특화된 지표(예: LISPRESS 매치 정확도, 정확한 매치)를 사용하여 모델 성능을 평가합니다.

실험 결과

연구 질문

  • RQ1문맥 자유 문법을 통한 제약된 디코딩는 다양한 언어 모델과 자원 수준에서 구문 분석 성능에 어떻게 기여하는가?
  • RQ2특히 자원이 제한된 환경에서 소수의 예제를 활용한 프롬프팅과 미세조정 간의 성능 차이는 어떠한가?
  • RQ3예시 순서 정렬 및 문맥 포함과 같은 다양한 프롬프팅 엔지니어링 전략은 소수의 예제를 활용한 모델 성능에 어떤 영향을 미치는가?
  • RQ4무작위 또는 히우리스틱 선택 대비 검색 기반 프롬프팅 선택 방법은 소수의 예제를 활용한 프롬프팅 정확도를 얼마나 향상시키는가?
  • RQ5부분적인 학습 데이터로부터 유도된 문법은 자원이 제한된 환경에서 제약된 디코딩 성능에 어떤 영향을 미치는가?

주요 결과

  • T5와 BART와 같은 미세조정된 인코더-디코더 모델은 제약된 디코딩를 적용할 경우 모든 구문 분석 데이터셋에서 최신 기술 수준의 성능에 도달하거나 이를 초월합니다.
  • 제약된 디코딩는 자원이 제한된 환경에서 가장 큰 성능 향상을 가져오며, 제약이 없는 생성 방식 대비 최대 5–7% 향상됩니다.
  • 소수의 예제를 활용한 프롬프팅 모델의 경우 제약된 디코딩가 필수적입니다. 이와 같은 조건에서 이를 생략하면 특히 구성 구문 분석 및 의존성 구문 분석과 같은 복잡한 작업에서 유효한 분석을 생성하지 못합니다.
  • 생성 헤드에 가장 관련성이 높은 예시를 가장 가까이 놓는 프롬프팅 엔지니어링 전략은 특히 자료가 적은 환경에서 소수의 예제를 활용한 성능을 향상시킵니다.
  • SentenceT5-xxl은 BM25 및 기타 문장 임베딩 모델보다 프롬프팅 검색에서 뛰어난 성능을 보이며, 저자원 설정에서 SMCalFlow에서 39.3%의 정확도를 기록합니다.
  • 전체 학습 데이터로부터 유도된 문법을 사용할 경우, 저자원 분할에서의 특정 분할에 맞춘 문법을 사용할 때보다 略적으로 더 높은 성능를 기록하며, 저자원 설정에서 분할 전용 문법을 사용할 경우 정확도가 1–2% 감소합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.