[논문 리뷰] TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks
TIGERScore는 참조 없이 지시에 따라 작동하고 해석 가능한 텍스트 생성 평가 지표로, 42,000개 샘플의 지시 훈련 데이터셋(MetricInstruct)을 미세튜닝한 LLaMA-2를 활용해 오류 분석을 수행하고 오류를 식별하며 보상 점수를 부여한다. 이는 일곱 가지 텍스트 생성 작업에서 인간 평가와의 최고 수준의 상관관계를 달성하며, 인간 평가한 설명의 정확도가 70.8%에 이른다.
We present TIGERScore, a extbf{T}rained metric that follows extbf{I}nstruction extbf{G}uidance to perform extbf{E}xplainable, and extbf{R}eference-free evaluation over a wide spectrum of text generation tasks. Different from other automatic evaluation methods that only provide arcane scores, TIGERScore is guided by natural language instruction to provide error analysis to pinpoint the mistakes in the generated text. Our metric is based on LLaMA-2, trained on our meticulously curated instruction-tuning dataset MetricInstruct which covers 6 text generation tasks and 23 text generation datasets. The dataset consists of 42K quadruple in the form of (instruction, input, system output $ ightarrow$ error analysis). We collected the `system outputs' through from a large variety of models to cover different types of errors. To quantitatively assess our metric, we evaluate its correlation with human ratings on 5 held-in datasets, 2 held-out datasets and show that TIGERScore can achieve the open-source SoTA correlation with human ratings across these datasets and almost approaches GPT-4 evaluator. As a reference-free metric, its correlation can even surpass the best existing reference-based metrics. To further qualitatively assess the rationale generated by our metric, we conduct human evaluation on the generated explanations and found that the explanations are 70.8\% accurate. Through these experimental results, we believe TIGERScore demonstrates the possibility of building universal explainable metrics to evaluate any text generation task. All the resourced are released in our project website: \url{https://tiger-ai-lab.github.io/TIGERScore/}.
연구 동기 및 목표
- 기존 자동 평가 지표의 한계를 해결하기 위해, 골드 참조에 의존하거나 다양한 작업 간 일반화 능력이 떨어지거나 오류 기여도를 제공하지 않는 문제를 해결한다.
- 다양한 텍스트 생성 작업에 적용 가능한 통합적이고 해석 가능하며 참조 없는 평가 지표를 개발한다.
- 오류 분석을 통해 오류를 식별하고 설명하며 보상 점수를 할당하여 모델 평가의 신뢰도와 해석 가능성을 향상시킨다.
- 참조 텍스트 없이도 다양한 벤치마크에서 인간 평가와 높은 상관관계를 달성한다.
제안 방법
- 42,000개 샘플의 정제된 지시 훈련 데이터셋(MetricInstruct)을 사용해 지시-입력-시스템 출력-오류 분석 형식의 입력-출력 쌍을 기반으로 LLaMA-2를 미세튜닝한다.
- 23개의 텍스트 생성 데이터셋과 6개의 작업에서 다양한 오류 유형을 커버하기 위해 50개 이상의 모델의 시스템 출력을 수집한다.
- GPT-4를 활용해 고품질의 오류 분석을 생성하고 필터링하여 사실적 정확성과 오류의 국소화를 확보한다.
- 평가 파이프라인을 설계해 각 오류에 대해 최종 보상 점수(개별 보상 점수의 합계)와 자연어 설명을 동시에 출력하도록 한다.
- 모델이 오류를 식별하고 그 성격을 설명하며 수정 제안을 할 수 있도록 훈련한다.
- 보존된 데이터셋과 보존되지 않은 데이터셋에서 인간 평가와의 페어슨, 스피어만, 켄달 상관계수를 사용해 지표를 평가한다.

실험 결과
연구 질문
- RQ1참조 없는 지표가 다양한 텍스트 생성 작업에서 인간 평가와 최고 수준의 상관관계를 달성할 수 있는가?
- RQ2지시에 따라 작동하는 LLM이 정확하고 국소화되며 실행 가능한 오류 설명을 생성할 수 있는가?
- RQ3훈련 데이터의 품질과 다양성이 해석 가능한 평가 지표의 일반화 능력과 성능에 어떤 영향을 미치는가?
- RQ4해석 가능한 지표가 기존의 參조 기반 및 參조 없는 기준 지표보다 상관관계와 해석 가능성 측면에서 뛰어나게 성능을 냈는가?
- RQ5단일 통합 지표가 작업별 특화된 적응 없이도 여러 텍스트 생성 작업을 효과적으로 평가할 수 있는가?
주요 결과
- TIGERScore는 일곱 가지 주요 텍스트 생성 작업에서 인간 평가와의 최고 수준의 켄달 상관계수를 달성했으며, 최고의 參조 없는 지표(GPTScore)보다 15% 높고, 최고의 參조 기반 지표(COMET-22)보다 8% 높다.
- 보존된 데이터셋에서 TIGERScore는 예상치 못한 일반화 능력을 보였으며, 최고의 參조 없는 지표보다 평균 켄달 상관계수에서 13점 향상되었고, 최고의 參조 기반 지표보다 6점 앞서나갔다.
- 인간 평가 결과에 따르면 TIGERScore가 생성한 오류 설명 중 70.8%가 정확하고 신뢰할 수 있어, 그 해석 가능성과 신뢰도를 검증했다.
- TIGERScore의 성공은 MetricInstruct 데이터셋의 세 가지 핵심 요소에 기인한다: 다양한 작업과 데이터셋의 높은 다양성, 오류 유형의 포괄적 커버리지, 고도로 정제된 주석.
- 대부분의 작업에서 TIGERScore는 GPT-4 제로샷 성능을 초월해 강력한 일반화 능력과 강인함을 입증했다.
- 요약, 번역, 대화-텍스트 변환, 추론 등 다양한 작업에서 뛰어난 성능을 보여, TIGERScore의 통합성과 보편성을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.