[논문 리뷰] GPTScore: Evaluate as You Desire
GPTScore는 주석 데이터 없이 다중 맞춤형 평가 측면에 걸쳐 생성된 텍스트를 점수화하기 위해 제로샷 지시와 맥락 내 예시를 활용하는 대형 사전학습 언어 모델을 사용합니다.
Generative Artificial Intelligence (AI) has enabled the development of sophisticated models that are capable of producing high-caliber text, images, and other outputs through the utilization of large pre-trained models. Nevertheless, assessing the quality of the generation is an even more arduous task than the generation itself, and this issue has not been given adequate consideration recently. This paper proposes a novel evaluation framework, GPTScore, which utilizes the emergent abilities (e.g., zero-shot instruction) of generative pre-trained models to score generated texts. There are 19 pre-trained models explored in this paper, ranging in size from 80M (e.g., FLAN-T5-small) to 175B (e.g., GPT3). Experimental results on four text generation tasks, 22 evaluation aspects, and corresponding 37 datasets demonstrate that this approach can effectively allow us to achieve what one desires to evaluate for texts simply by natural language instructions. This nature helps us overcome several long-standing challenges in text evaluation--how to achieve customized, multi-faceted evaluation without the need for annotated samples. We make our code publicly available at https://github.com/jinlanfu/GPTScore.
연구 동기 및 목표
- 주석 및 학습 요구를 최소화하면서 유연하고 다면적 텍스트 평가의 부족을 해결한다.
- 생성형 대형 모델의 신생 능력(제로샷 지시, 맥락 내 학습)을 활용하여 생성된 텍스트를 점수화한다.
- 조건부 생성 확률을 점수로 계산하기 위한 작업, 측면 및 맥락 정의 프로토콜을 제공한다.
- 다양한 NLG 작업에서 여러 백본(GPT-2, OPT, FLAN-T5, GPT-3)을 비교하여 신뢰성과 일반성을 평가한다.
제안 방법
- GPTScore를 제안하며, 이는 프롬프트 T(d,a,S)와 맥락 S에 조건화된 h의 토큰 로그 확률의 가중합으로 GPTScore(h|d,a,S)를 계산한다 (p(y|x,θ)).
- 작업 설명 d 및 측면 정의 a를 통해 평가 프로토콜을 정의하고, 모델을 맥락 내 학습으로 안내하기 위한 선택적 예시 샘플을 제공합니다.
- 다른 작업과 측면에 대한 평가 프로토콜과 측면 정의를 인코딩하는 프롬프트 템플릿 T(·)을 사용합니다.
- GPT-3, OPT, FLAN-T5, GPT-2를 포함한 백본으로 GPTScore를 인스턴스화하여 디코더 전용과 인코더-디코더 아키텍처를 탐구합니다.
- 작업 전반에 걸쳐 인간 판단과의 정합성을 높이기 위해 두 가지 점수화 변형: src->hypo(소스 기반) 및 ref->hypo(골드 참조 기반)를 탐구합니다.
실험 결과
연구 질문
- RQ1지시 기반 프롬프트와 맥락 내 시연이 다양한 NLP 작업에서 생성된 텍스트의 학습 없는 다면적 평가를 가능하게 할 수 있는가?
- RQ2다양한 백본(GPT-3, GPT-2, OPT, FLAN-T5, GPT-J)이 데이터셋에서 신뢰성과 인간 판단과의 상관관계 측면에서 어떻게 비교되는가?
- RQ3다양한 작업과 측면에서 점수화 기초로 소스 대 참조를 사용하는 것이 어떤 영향을 미치는가?
- RQ4작업 정의와 측면 정의가 요약, 대화, 데이터-텍스트, 기계 번역 등 도메인 전반에 걸친 GPTScore의 신뢰도에 어느 정도 영향을 미치는가?
주요 결과
- 지시 기반 프롬프팅은 많은 설정에서 GPTScore 성능을 크게 향상시킨다.
- 디코더 전용 모델은 인스트럭션과 시연으로부터 인코더-디코더 모델보다 더 큰 이점을 얻는 경우가 많다.
- GPT3-d03가 일반적으로 GPT3-d01보다 우수하지만, GPT3-c01은 MT에서 경쟁력 있는 결과를 제공하는 비용 효율적인 대안이다.
- 작업 전반에 걸쳐, 지시가 있는 GPTScore는 인간 판단과의 상관관계에서 일부 감독 학습 또는 전통적 지표보다 우수할 수 있다.
- GPTScore는 여러 모델 계열에 대해 IDM(Instruction with Demonstrations)을 결합했을 때 일관된 이득을 보인다.
- 요약, MT, 데이터-텍스트, 대화 작업 전반에서 GPTScore 변형이 인간 판단과 의미 있는 상관관계를 보인다(실험에 보고된 바와 같이).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.