Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models on Wikipedia-Style Survey Generation: an Evaluation in NLP Concepts

Fan Gao, Hang Jiang|arXiv (Cornell University)|2023. 08. 21.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 GPT-4, PaLM2, LLaMA2, GPT-3.5와 같은 대규모 언어 모델(LM)이 99개의 NLP 주제에 대해 위키백과 스타일의 종합 기사 생성 능력을 평가한다. 제로샷, 원샷, 설명 프롬프트 설정을 통해 평가한 결과, GPT-4는 인간이 작성한 기준 기사보다 더 현대적이고 접근성 있고 종종 더 높은 품질의 콘텐츠를 생성하지만, 때로는 사실 오류나 모호한 표현을 포함하기도 한다. 본 연구는 또한 GPT-4가 자체 생성한 텍스트를 평가할 때 체계적인 편향을 보임을 밝혀냈다.

ABSTRACT

Educational materials such as survey articles in specialized fields like computer science traditionally require tremendous expert inputs and are therefore expensive to create and update. Recently, Large Language Models (LLMs) have achieved significant success across various general tasks. However, their effectiveness and limitations in the education domain are yet to be fully explored. In this work, we examine the proficiency of LLMs in generating succinct survey articles specific to the niche field of NLP in computer science, focusing on a curated list of 99 topics. Automated benchmarks reveal that GPT-4 surpasses its predecessors, inluding GPT-3.5, PaLM2, and LLaMa2 by margins ranging from 2% to 20% in comparison to the established ground truth. We compare both human and GPT-based evaluation scores and provide in-depth analysis. While our findings suggest that GPT-created surveys are more contemporary and accessible than human-authored ones, certain limitations were observed. Notably, GPT-4, despite often delivering outstanding content, occasionally exhibited lapses like missing details or factual errors. At last, we compared the rating behavior between humans and GPT-4 and found systematic bias in using GPT evaluation.

연구 동기 및 목표

  • 특정 NLP 주제에 대해 구조적이고 교육적인 종합 기사 생성 능력을 LLM이 얼마나 잘 수행하는지 평가하는 것.
  • 품질, 정확도, 구조 측면에서 LLM이 생성한 종합 기사와 인간이 작성한 기준 기사 간의 비교.
  • LLM이 텍스트 품질 평가 시 인간의 판단을 모방할 수 있는지 조사하는 것.
  • 인간 평가 대비 LLM 기반 평가에서 나타나는 체계적 편향을 규명하는 것.

제안 방법

  • 100개의 인간이 작성한 NLP 종합 기사로 구성된 Surfer100 데이터셋을 사용하였으며, 각 기사는 Introduction, History, Key Ideas, Applications, Variations의 다섯 가지 표준 섹션을 포함한다.
  • GPT-4, GPT-3.5, PaLM2, LLaMA2의 네 가지 LLM을 제로샷(ZS), 원샷(OS), 설명 프롬프트(DP), 원샷에 설명 프롬프트를 추가한 설정(OSP) 등 네 가지 프롬프팅 설정에서 평가하였다.
  • 사실 기반을 강화하기 위해 위키백과 및 웹 데이터에 연결하는 검색 기반 생성(RAG) 설정(OS+IR)을 도입하였다.
  • ROUGE, BERTScore, MoverScore, UniEval, BARTScore 등의 자동 평가 지표를 적용하여 생성 품질을 수량화하였다.
  • 전문 평가자들이 Krippendorff’s 및 Kendall’s 계수를 사용하여 평가자 간 일致도와 품질 평가를 수행하였다.
  • GPT-4가 자체 생성한 결과물을 평가한 점수를 인간 평가 점수와 비교하여 LLM 기반 평가에서의 체계적 편향을 탐지하였다.
(a) Error Type Distribution.
(a) Error Type Distribution.

실험 결과

연구 질문

  • RQ1RQ1: LLM은 NLP 개념에 대한 종합 기사 생성 능력에서 얼마나 전문적인가?
  • RQ2RQ2: 특정 기준이 제공될 경우 LLM은 인간의 판단을 모방할 수 있는가?
  • RQ3RQ3: LLM은 기계가 생성한 텍스트를 평가할 때 인간이 작성한 텍스트와 비교해 뚜렷한 편향을 보이는가?

주요 결과

  • GPT-4는 ROUGE, BERTScore, MoverScore, UniEval, BARTScore 등 모든 자동 평가 지표에서 GPT-3.5, PaLM2, LLaMA2를 앞서는 최고의 점수를 기록하였다.
  • 인간 평가 결과, GPT-4가 생성한 종합 기사들은 인간이 작성한 기사보다 더 현대적이고 접근성 있으며, 명확성과 구조성 면에서 높은 평가를 받았다.
  • 강력한 성능에도 불구하고 GPT-4는 때로 사실 오류나 핵심 정보 누락을 일으켰으며, 예를 들어 결정 트리에 관한 기사에서 중요한 사건을 누락하기도 하였다.
  • GPT-4가 생성한 콘텐츠는 때로 인간이 작성한 기준 기사보다 깊이 있고 정밀도 면에서 뛰어났다. 예를 들어, mBERT의 공유 임베딩 공간이나 HMM의 알고리즘적 특징을 정확히 식별한 바 있다.
  • GPT-4의 평가에서 체계적 편향이 확인되었다. 인간 전문가가 더 우수하다고 평가한 기사보다도 GPT-4는 자신의 출력물에 대해 더 유리하게 평가하는 경향이 있었다.
  • 연구에서는 ‘주제가 NLP에서 중요한 역할을 한다’와 같은 모호한 문장 구조가 여러 주제에 걸쳐 반복적으로 사용되는 것을 발견하여, 적용 섹션에서 구체성 부족을 드러냈다.
(b) Error Type Distribution.
(b) Error Type Distribution.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.