Skip to main content
QUICK REVIEW

[논문 리뷰] EditEval: An Instruction-Based Benchmark for Text Improvements

Jane Dwivedi-Yu, Timo Schick|arXiv (Cornell University)|2022. 09. 27.
Software Engineering Research인용 수 8
한 줄 요약

EditEval는 복수의 텍스트 편집 작업, 예를 들어 어색함 제거, 어조 중립화, 정보 갱신 등에 대해 지시 기반 언어 모델을 평가하기 위한 통합형 기준 평가 벤치마크이다. 다양한 데이터셋을 표준화하고, 최신 기술 모델을 다수의 평가 지표를 사용해 평가하며, InstructGPT와 PEER가 가장 뛰어난 성능을 보였지만 대부분의 모델이 지도 학습 기반 최고 성능(SOTA)에 뒤처지며, 특히 정보 갱신 및 중립화 작업에서 뚜렷한 격차를 보이고 있음을 확인하였다. 또한 평가 지표 간 상관관계가 낮고, 프롬프트에 민감한 경향이 있음을 발견하였다.

ABSTRACT

Evaluation of text generation to date has primarily focused on content created sequentially, rather than improvements on a piece of text. Writing, however, is naturally an iterative and incremental process that requires expertise in different modular skills such as fixing outdated information or making the style more consistent. Even so, comprehensive evaluation of a model's capacity to perform these skills and the ability to edit remains sparse. This work presents EditEval: An instruction-based, benchmark and evaluation suite that leverages high-quality existing and new datasets for automatic evaluation of editing capabilities such as making text more cohesive and paraphrasing. We evaluate several pre-trained models, which shows that InstructGPT and PEER perform the best, but that most baselines fall below the supervised SOTA, particularly when neutralizing and updating information. Our analysis also shows that commonly used metrics for editing tasks do not always correlate well, and that optimization for prompts with the highest performance does not necessarily entail the strongest robustness to different models. Through the release of this benchmark and a publicly available leaderboard challenge, we hope to unlock future research in developing models capable of iterative and more controllable editing.

연구 동기 및 목표

  • 반복적이고 모듈러한 텍스트 편집 작업에 대한 종합적인 평가 부족 문제를 해결하며, 인간의 글쓰기 관행과 대비되는 언어 모델의 평가 부족을 보완한다.
  • 다양한 도메인에서 고품질 데이터셋을 식별하고 표준화하여, 통일성, 단순화, 갱신 등의 편집 능력을 평가할 수 있도록 한다.
  • 지시 기반 프롬프팅과 다수의 평가 지표를 지원하는 통합 평가 프레임워크를 개발하여 일관된 벤치마크를 구현한다.
  • 최신 기술 모델의 편집 작업 성능을 평가하고, 프롬프트의 강건성과 평가 지표 간 상관관계를 분석한다.
  • 오픈소스 코드, 데이터, 공개 리더보드를 제공하여 향후 제어 가능하고 반복적인 텍스트 생성 연구를 지원한다.

제안 방법

  • 기존 및 신규 데이터셋(예: WAFER-insert)을 통합하고 평가에 적합한 일관된 형식으로 표준화한다.
  • 중립화, 단순화, 어색함 제거, 어색함 제거, 정보 갱신 등의 편집 작업을 위한 태스크 전용 인간 애너테이션 지침을 설계한다.
  • BLEU, ROUGE, SARI, EM-Diff, UpdateROUGE 등의 표준 평가 지표를 사용해 다수의 사전 학습된 모델(GPT-3, OPT, InstructGPT, PEER)을 평가한다.
  • 모델과 프롬프트 수준에서 성능을 측정하여 프롬프트 어조에 따른 강건성과 민감도를 평가한다.
  • 모델과 태스크 간 상관관계 분석을 위해 피어슨 상관계수를 사용하여 평가 지표의 신뢰성과 일관성을 평가한다.
  • 코드, 데이터, 공개 리더보드를 함께 제공하여 재현 가능성과 공동 평가를 지원하는 벤치마크를 공개한다.

실험 결과

연구 질문

  • RQ1기존의 사전 학습된 언어 모델은 어색함 제거, 어색함 제거, 정보 갱신 등의 지시 기반 텍스트 편집 작업에서 얼마나 잘 수행되는가?
  • RQ2BLEU, ROUGE, SARI와 같은 일반적으로 사용되는 자동 평가 지표들이 상호 간 및 인간 평가와 얼마나 상관관계가 있는가?
  • RQ3프롬프트 어조는 다양한 편집 작업과 모델 간에 모델 성능과 강건성에 어떤 영향을 미치는가?
  • RQ4통합 벤치마크는 다양한 도메인과 작업에서 다양한 편집 능력을 효과적으로 평가할 수 있는가?
  • RQ5현재 평가 지표와 모델 행동의 주요 한계는 무엇인가?

주요 결과

  • InstructGPT와 PEER는 모든 편집 작업에서 가장 높은 성능를 보였지만, 대부분의 기준 모델은 특히 중립화 및 정보 갱신 작업에서 지도 학습 기반 SOTA에 크게 뒤져 있었다.
  • ROUGE와 BLEU와 같은 일반적으로 사용되는 지표들 간 상관관계가 낮았으며(예: -0.29에서 -0.1 사이), ROUGE는 SARI나 UpdateROUGE와 자주 충돌했다.
  • 최고 성능를 위한 프롬프트가 반드시 모든 모델에서 강건한 것은 아니었다. 예를 들어, 명료성 향상을 위한 프롬프트 #5는 가장 높은 점수를 기록했지만, 1분위수와 3분위수 간 범위(IQR)가 가장 넓어 변동성이 높음을 시사했다.
  • 어느 정도 모호하거나 흔치 않은 어조(예: '관점 제거' 또는 '이 텍스트를 다시 작성하라'와 같은 구체적 정보 없음)를 사용한 프롬프트는 모델 행동의 일관성 없음을 초래하여 강건성이 떨어졌다.
  • 통일성, 어색함 제거, 중립화와 같은 태스크는 외곽치 행동을 보였는데, 이는 T0(낮은 성능)와 InstructGPT/PEER(높은 성능) 사이의 성능 격차가 극명하기 때문이다.
  • 벤치마크는 프롬프트 성능 최적화가 강건성을 보장하지는 않음을 드러내었으며, 체계적인 프롬프트 선택과 더 나은 평가 지표 개발의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.