Skip to main content
QUICK REVIEW

[논문 리뷰] All That's 'Human' Is Not Gold: Evaluating Human Evaluation of Generated Text

Elizabeth A. Clark, Tal August|arXiv (Cornell University)|2021. 06. 30.
Topic Modeling인용 수 16
한 줄 요약

이 연구는 스토리, 뉴스 기사, 요리법 등 다양한 분야에서 GPT3가 생성한 텍스트와 인간이 작성한 텍스트를 비전문가 평가자가 구분할 수 있는지 평가한다. 상세 지침, 주석 예시, 쌍대 비교를 통해 훈련을 거친 후에도 평가자는 최대 55%의 정확도에 그치며, 우연의 성능을 뛰어나지 못함을 확인하여 현대적 자연어 생성(NLG) 모델 평가에 있어 비전문가 평가의 한계를 드러낸다.

ABSTRACT

Human evaluations are typically considered the gold standard in natural language generation, but as models' fluency improves, how well can evaluators detect and judge machine-generated text? We run a study assessing non-experts' ability to distinguish between human- and machine-authored text (GPT2 and GPT3) in three domains (stories, news articles, and recipes). We find that, without training, evaluators distinguished between GPT3- and human-authored text at random chance level. We explore three approaches for quickly training evaluators to better identify GPT3-authored text (detailed instructions, annotated examples, and paired examples) and find that while evaluators' accuracy improved up to 55%, it did not significantly improve across the three domains. Given the inconsistent results across text domains and the often contradictory reasons evaluators gave for their judgments, we examine the role untrained human evaluations play in NLG evaluation and provide recommendations to NLG researchers for improving human evaluations of text generated from state-of-the-art models.

연구 동기 및 목표

  • 비전문가 평가자가 다양한 도메인에서 인간이 작성한 텍스트와 GPT3가 생성한 텍스트를 신뢰성 있게 구별할 수 있는지 평가하기.
  • 상세 지침, 주석 예시, 쌍대 비교를 통해 평가자를 훈련시키면 기계 생성 텍스트 식별 정확도가 향상되는지 조사하기.
  • 생성 텍스트의 인간다움을 평가할 때 평가자가 주로 고려하는 텍스트적 특성 분석하기.
  • 현대 자연어 생성(NLG) 모델 평가의 금표로서 인간 평가의 신뢰성 평가하기.
  • NLG 연구 분야에서 인간 평가 관행을 향상시키기 위한 실천 가능한 권고안 제공하기.

제안 방법

  • 스토리, 뉴스 기사, 요리법 3개 도메인에서 나온 500개 텍스트 샘플을 대상으로 비전문가 참가자들을 대상으로 인간 평가 연구 수행.
  • 각 텍스트에 대해 '확실히 인간이 작성한 것', '아마도 인간이 작성한 것', '아마도 기계가 생성한 것', '확실히 기계가 생성한 것'이라는 4단계 척도를 제시.
  • 세 가지 별도의 훈련 조건 제공: 상세 지침, 주석 예시, 인간-기계 대비 예시.
  • 평가자의 평가에 대한 정성적 설명을 수집하여 평가자의 추론 방식과 주요 초점 분석.
  • 평가자의 판단과 실제 텍스트 출처 간 상관관계 분석하여 도메인 간 정확도와 일관성 측정.
  • 통계적 분석을 통해 훈련 방법이 식별 성능 향상에 유의미한 영향을 미치는지 평가.

실험 결과

연구 질문

  • RQ1비전문가 평가자가 여러 도메인에서 GPT3가 생성한 텍스트와 인간이 작성한 텍스트를 신뢰성 있게 구별할 수 있는가?
  • RQ2상세 지침, 주석 예시, 쌍대 비교를 통해 평가자에게 훈련을 제공하면 기계 생성 텍스트 식별 능력이 유의미하게 향상되는가?
  • RQ3평가자가 생성 텍스트의 인간다움을 평가할 때 주로 고려하는 텍스트적 특성들은 무엇인가?
  • RQ4평가자의 판단은 다양한 텍스트 도메인 간 일관성이 있는가? 일관성의 부재는 무엇으로 설명되는가?
  • RQ5평가자는 얼마나 심각하게 최신 언어 모델의 출력 품질을 과소평가하는가?

주요 결과

  • 비전문가 평가자는 모든 3개 도메인에서 GPT3가 생성한 텍스트와 인간이 작성한 텍스트를 랜덤 추측 수준을 넘어서 구별하지 못함.
  • 상세 지침, 주석 예시, 쌍대 비교를 통해 훈련을 거친 후에도 평가자의 정확도는 근소하게 향상되어 최대 55%에 그침.
  • 평가자는 주로 문법, 철자, 스타일과 같은 표면적 특성에 초점을 맞추며, 내용 품질이나 사실 일관성은 고려하지 않음.
  • 판단이 종종 모순됨: 동일한 텍스트 특성이 인간 작성과 기계 생성 모두를 정당화하는 데 사용되어 높은 일관성 부족을 보임.
  • 평가자는 GPT3가 생성한 텍스트의 품질을 체계적으로 과소평가함. 많은 경우 고성능 모델 출력물조차 '확실히 인간이 작성한 것'으로 평가함.
  • 본 연구는 현재의 인간 평가 관행이 현대 NLG 모델 평가에 부적절하며, 특히 어휘적 유창성 오류가 아닌 내용 오류의 경우 더욱 그러하다는 점을 드러냄.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.