Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Dimensional Evaluation of Text Summarization with In-Context Learning

Sameer Jain, Vaishakh Keshava|arXiv (Cornell University)|2023. 06. 01.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 사용한 다차원 텍스트 요약 평가를 위한 학습이 없는, 인-컨텍스트 학습 기반 프레임워크인 Ice를 제안한다. GPT-3에 소량의 인-컨텍스트 예시를 제시함으로써, Ice는 사실성 일관성과 관련성 측면에서 최신 기술 수준(SOTA) 성능을 달성하며, 참조 기반 메트릭인 ROUGE와 BARTScore보다 인간 평가와 더 잘 일치하는 성능을 보이며, 인-컨텍스트 예시 선택 및 수량 변화에 대해 안정성을 유지한다.

ABSTRACT

Evaluation of natural language generation (NLG) is complex and multi-dimensional. Generated text can be evaluated for fluency, coherence, factuality, or any other dimensions of interest. Most frameworks that perform such multi-dimensional evaluation require training on large manually or synthetically generated datasets. In this paper, we study the efficacy of large language models as multi-dimensional evaluators using in-context learning, obviating the need for large training datasets. Our experiments show that in-context learning-based evaluators are competitive with learned evaluation frameworks for the task of text summarization, establishing state-of-the-art on dimensions such as relevance and factual consistency. We then analyze the effects of factors such as the selection and number of in-context examples on performance. Finally, we study the efficacy of in-context learning based evaluators in evaluating zero-shot summaries written by large language models such as GPT-3.

연구 동기 및 목표

  • 대규모 애너테이션된 학습 데이터셋에 의존하지 않는, 다차원 요약 평가를 위한 학습이 없는 확장 가능한 방법을 개발하는 것.
  • LLM을 사용한 인-컨텍스트 학습이 사실성 일관성 및 관련성과 같은 차원에서 미세조정된 평가 모델의 성능을 따라하거나 능가할 수 있는지 평가하는 것.
  • 인-컨텍스트 예시 선택 및 수량 변화에 대한 인-컨텍스트 학습 평가자 성능의 안정성 평가.
  • GPT-3 등의 모델이 생성한 제로샷 요약을 평가할 때 인-컨텍스트 학습 평가자(예: Ice)가 인간 평가와 얼마나 잘 일치하는지 조사하는 것.
  • 참조 기반 메트릭보다 참조 없는 평가 방식이 비모방적, 제로샷 생성물에 대해 인간의 선호도를 더 잘 반영할 수 있음을 보여주는 것.

제안 방법

  • Ice는 각각 생성된 요약과 해당 품질 점수를 포함하는 소량의 인-컨텍스트 예시를 사용하여, 대규모 언어 모델(GPT-3 text-davinci-003)을 평가하도록 프롬프트한다.
  • 평가 차원에 따라 소스 텍스트, 기준 요약(관련성용), 또는 둘 다를 포함하며, 평가 대상이 되는 테스트 요약을 마지막에 제시한다.
  • 각 차원(일관성, 관련성, 어휘적 자연스러움, 흐름)에 대해 고유한 프롬프트 템플릿을 설계하여 LLM이 관련 맥락을 고려하고 0에서 1 사이의 숫자 점수를 산출하도록 유도한다.
  • 모델의 결정론적 출력(온도 = 0)을 디코딩하고 결과로 나오는 숫자 문자열을 파싱하여 점수를 추출한다.
  • 프레임워크는 확장 가능하다: 새로운 평가 차원을 추가하려면 재학습이 아닌, 소량의 예시 쌍과 함께 새로운 프롬프트만 필요하다.
  • 성능 평가는 표준 벤치마크에서 인간 애너테이션 점수를 사용하며, 학습된 기준 모델(BRIO, T0), ROUGE, BARTScore 등과의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1LLM을 사용한 인-컨텍스트 학습이 다차원 텍스트 요약 평가에서 미세조정된 평가 모델의 성능을 경쟁하거나 능가할 수 있는가?
  • RQ2인-컨텍스트 학습 평가자의 성능은 인-컨텍스트 예시의 선택 및 수량 변화에 얼마나 민감한가?
  • RQ3GPT-3의 제로샷 요약을 평가할 때 인-컨텍스트 학습 평가자(Ice)가 참조 기반 메트릭보다 인간 평가와 더 잘 일치하는가?
  • RQ4Ice는 추가적인 미세조정이나 대규모 인간 애너테이션 데이터 없이도 새로운 평가 차원을 평가할 수 있는가?
  • RQ5ROUGE나 BARTScore와 같은 기존 자동 메트릭보다 Ice가 참조를 모방하지 않는 요약물에 대해 인간 선호도를 얼마나 더 잘 반영하는가?

주요 결과

  • Ice는 인간 평가에서 사실성 일관성(0.996)과 관련성(0.849) 측면에서 최신 기술 수준 성능을 달성하며, BRIO나 T0와 같은 학습된 기준 모델을 뛰어넘는다.
  • 더 많은 인-컨텍스트 예시를 사용할수록 성능이 약간 향상되며, 균일하거나 다양한 방법으로 예시를 샘플링하더라도 안정성이 유지된다.
  • 단 한 개의 인-컨텍스트 예시만으로도 Ice는 약한 미세조정된 기준 모델의 성능에 가까운 성능을 달성하여, 사전 훈련에서 유도된 강력한 인덕티브 바이어스를 보여준다.
  • Ice는 제로샷 GPT-3 요약에 대해 인간 평가와 높은 일치도(전반적 점수 0.937)를 보이며, ROUGE와 BARTScore는 GPT-3 요약을 인간 선호도보다 일관되게 낮게 평가한다.
  • Ice의 참조 없는 설계 덕분에 GPT-3의 제로샷 요약을 더 잘 평가할 수 있으며, 이는 참조 기반 메트릭이 비모방적 성격으로 인해 이러한 요약을 과도하게 낮게 평가하기 때문이다.
  • 프레임워크는 확장 가능하다: 새로운 평가 차원을 추가하려면 재학습이나 합성 데이터 생성 없이 소량의 예시 쌍과 함께 프롬프트 엔지니어링만으로 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.