Skip to main content
QUICK REVIEW

[논문 리뷰] Scarecrow: A Framework for Scrutinizing Machine Text.

Yao Dou, Maxwell Forbes|arXiv (Cornell University)|2021. 07. 02.
Topic Modeling참고 문헌 34인용 수 15
한 줄 요약

Scarecrow는 신경망 텍스트 생성에서 의미적, 서사적, 논의적 오류를 식별하기 위한 커뮤니티 기반의 구조화된 오류 주석 체계이다. 이는 1.3천 개의 인간 및 기계 생성 뉴스 단락에 걸쳐 13,000개의 주석을 분석함으로써 GPT 모델의 성능 차이를 매개변수, 훈련 데이터, 디코딩 기법에 따라 드러내며, 데이터셋과 툴킷을 공개적으로 배포하였다.

ABSTRACT

Modern neural text generation systems can produce remarkably fluent and grammatical texts. While earlier language models suffered from repetition and syntactic errors, the errors made by contemporary models are often semantic, narrative, or discourse failures. To facilitate research of these complex error types, we introduce a new structured, crowdsourced error annotation schema called Scarecrow. The error categories used in Scarecrow -- such as redundancy, commonsense errors, and incoherence -- were identified by combining expert analysis with several pilot rounds of ontology-free crowd annotation to arrive at a schema which covers the error phenomena found in real machine generated text. We use Scarecrow to collect 13k annotations of 1.3k human and machine generate paragraphs of English language news text, amounting to over 41k spans each labeled with its error category, severity, a natural language explanation, and antecedent span (where relevant). We collect annotations for text generated by state-of-the-art systems with varying known performance levels, from GPT-2 Small through the largest GPT-3. We isolate several factors for detailed analysis, including parameter count, training data, and decoding technique. Our results show both expected and surprising differences across these settings. These findings demonstrate the value of Scarecrow annotations in the assessment of current and future text generation systems. We release our complete annotation toolkit and dataset at this https URL.

연구 동기 및 목표

  • 기계 생성 텍스트에서 복잡한 의미적 및 논의적 오류를 식별하기 위한 구조화되고 커뮤니티 기반의 오류 주석 체계 개발
  • 최신 신경망 텍스트 생성 시스템에서 문법적 오류에서 의미 수준의 오류로의 전환 다루기
  • GPT-2 Small 및 GPT-3를 포함한 다양한 텍스트 생성 모델을 대상으로 13,000개의 오류 주석 수집 및 분석
  • 모델 매개변수, 훈련 데이터, 디코딩 전략이 오류 패턴에 미치는 영향을 분리하고 평가하기
  • 미래의 텍스트 생성 평가 연구를 지원하기 위해 종합적인 주석 툴킷과 데이터셋 공개

제안 방법

  • 오늘날의 기계 생성 텍스트에서 실제로 발생하는 오류를 기반으로 하여, 전문가 분석과 반복적인 온톨로지 없는 커뮤니티 주석을 통해 Scarecrow 개발
  • 실제 기계 생성 텍스트를 바탕으로 재중복성, 일반지식 위반, 불일치성 등의 오류 유형 정의
  • 인간 및 기계 생성 영문 뉴스 텍스트 1.3천 개의 단락에 걸쳐 총 13,000개의 주석 수집
  • 각 주석에는 오류 유형, 심각도, 자연어 설명, 필요에 따라 전행 구간 포함
  • 최신 기술 모델인 GPT-2 Small부터 최대 규모의 GPT-3에 이르기까지 생성된 텍스트에 체계 적용
  • 모델의 매개변수 수, 훈련 데이터, 디코딩 기법에 따라 다양한 모델 유형 간 비교 분석 수행

실험 결과

연구 질문

  • RQ1다양한 신경망 텍스트 생성 모델 간 의미적 및 논의 수준의 오류는 어떻게 달라지나?
  • RQ2모델 매개변수, 훈련 데이터, 디코딩 전략은 오류 빈도와 유형에 어떤 영향을 미치는가?
  • RQ3Scarecrow 주석 체계는 기계 생성 텍스트의 미세한 오류 현상을 얼마나 잘 포착하는가?
  • RQ4인간이 작성한 문단과 모델이 생성한 문단 간 오류 패턴에 체계적인 차이가 존재하는가?
  • RQ5더 큰 모델은 의미적 및 논의적 오류의 수가 적거나 유형이 다를 정도로 더 적은 오류를 보이는가?

주요 결과

  • Scarecrow는 기계 생성 텍스트에서 재중복성, 일반지식 위반, 불일치성과 같은 광범위한 의미적 및 논의 수준의 오류를 성공적으로 포착한다.
  • GPT-3와 같은 더 큰 모델은 GPT-2 Small와 같은 더 작은 모델보다 전체 오류 비율이 낮지만, 오류 유형은 상당히 다름.
  • 디코딩 기법은 오류 패턴에 상당한 영향을 미치며, 온도 및 top-p 샘플링은 일관성과 사실적 일관성에 영향을 줌.
  • 훈련 데이터 구성은 일반지식 및 서사 일관성 오류 프로파일 형성에 측정 가능한 영향을 미치며, 특히 이 분야에서 중요함.
  • 주석 과정을 통해 예상되는 추세 외에도 놀라운 변동성을 발견하였으며, 특히 고성능 모델에서 예상치 못한 오류 집합이 발생함.
  • 공개된 데이터셋과 툴킷은 향후 텍스트 생성 시스템의 벤치마킹 및 개선을 위한 견고한 기반 제공

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.