[논문 리뷰] INSTRUCTSCORE: Explainable Text Generation Evaluation with Finegrained Feedback
InstructScore는 인간 레이팅 데이터가 필요 없이 GPT-4의 암묵적 지식을 활용해 자연어 진단 보고서를 생성함으로써 세밀하고 설명 가능한 텍스트 생성 평가 지표이다. 이 지표는 오류 유형, 위치, 심각도 및 근거를 식별한다. 7B LLaMA 기반 모델은 모든 비지도 평가 지표를 능가하며, COMET22와 같은 지도 학습 최첨단 모델과도 견줄 정도로 성능을 보이며, 반복적 개선 후 인간 판단과의 일치도가 13.7% 향상되었다.
Automatically evaluating the quality of language generation is critical. Although recent learned metrics show high correlation with human judgement, these metrics can not explain their verdict or associate the scores with defects in generated text. To address this limitation, we present InstructScore, an explainable evaluation metric for text generation. By harnessing both explicit human instruction and the implicit knowledge of GPT-4, we fine-tune a text evaluation metric based on LLaMA, producing both a score for generated text and a human readable diagnostic report. We evaluate InstructScore on a variety of generation tasks, including translation, captioning, data-to-text and commonsense generation. Experiments show that our 7B model surpasses all other unsupervised metrics, including those based on 175B GPT-3 and GPT-4. Surprisingly, our InstructScore, even without direct supervision from human-rated data, achieves performance levels on par with state-of-the-art metrics like COMET22, which were fine-tuned on human ratings.
연구 동기 및 목표
- 생성된 텍스트에 대해 세부적이고 인간이 읽을 수 있는 진단 보고서를 제공하는 설명 가능하고 세밀한 텍스트 생성 평가 지표를 개발하는 것.
- 인간 레이팅 점수에 의존하지 않고 오류 유형, 위치, 심각도 및 근거를 식별함으로써 세밀한 오류 탐지를 가능하게 하는 것.
- GPT-4를 메타 평가자로 활용해 자기지도 피드백 루프를 통해 인간 판단과의 일치도를 향상시키는 것.
- 다양한 텍스트 생성 작업에 적용 가능한 일반화 가능한 비지도 학습 파이프라인을 구축하는 것.
- 기존 비지도 지표를 능가하면서도 해석 가능성은 유지하는 인간 판단과의 상관관계를 향상시키는 것.
제안 방법
- 명시적인 지침 템플릿을 사용해 GPT-4에 텍스트 생성 오류에 대한 구조화된 진단 보고서를 생성하도록 프롬프팅하여 합성 데이터셋을 구축한다.
- 정확성, 일관성 및 인간 판단과의 일치도를 평가하기 위해 GPT-4에 오류 설명을 질의하는 피드백 파이프라인을 설계한다.
- 자기 생성된 진단 출력 데이터에 대해 7B LLaMA 기반 모델을 피지컬 트레이닝하여 피드백 점수 최적화를 통해 설명 품질을 향상시킨다.
- 실제 기계 생성 출력물에서 실패 모드를 샘플링하고 GPT-4 피드백을 통해 재평가함으로써 반복적으로 모델을 개선한다.
- 다중턴 프롬프트 프레임워크를 적용해 오류 주석을 검증하며, 오류 위치 추출, 어휘 일치, 심각도 분류를 포함한다.
- GPT-4를 활용한 자동 평가를 적용해 진단 보고서를 평가하며, 정확한 오류 없음 주장에 대해서는 1, 잘못되거나 일관성 없는 주장에 대해서는 0을 할당한다.

실험 결과
연구 질문
- RQ1비지도 텍스트 평가 지표가 수치적 점수를 설명하는 세부적이고 인간이 읽을 수 있는 진단 보고서를 생성할 수 있는가?
- RQ27B LLaMA 기반 모델이 텍스트 생성 평가에서 175B의 폐쇄 소스 모델과 비교해 얼마나 잘 수행되는가?
- RQ3GPT-4에서 유도된 자기지도 피드백이 인간 레이팅 데이터 없이도 인간 판단과의 일치도를 얼마나 향상시킬 수 있는가?
- RQ4이 지표는 번역, 캡셔닝, 공리적 생성과 같은 다양한 텍스트 생성 작업에 일반화될 수 있는가?
- RQ5진단 보고서에서 나타나는 실패 모드는 무엇이며, 이를 체계적으로 탐지하고 수정할 수 있는가?
주요 결과
- 7B InstructScore 모델은 여러 텍스트 생성 작업에서 GPT-3(175B) 및 GPT-4 기반 지표를 포함한 기존 모든 비지도 지표를 능가한다.
- InstructScore는 인간 레이팅 데이터 없이도 기계 번역 분야에서 COMET22와 같은 지도 학습 최첨단 지표와 동등한 성능을 보이며, 성능을 확보한다.
- InstructScore는 9개 번역 방향 중 6개에서 지도 학습 기반 BLEURT를 능가하여 강력한 제로샷 일반화 능력을 입증한다.
- GPT-4 피드백을 활용한 반복적 개선 후 InstructScore는 인간 판단과의 일치도를 13.7% 향상시켰다.
- 이 방법은 오류 위치를 잘못 식별하거나 심각도를 잘못 분류하는 등의 일반적인 실패 모드를 성공적으로 식별하고 수정한다.
- InstructScore가 생성한 진단 보고서는 인간 주석과 매우 일치하며, GPT-4가 98%의 오류 없음 주장이 정확하다고 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.