Skip to main content
QUICK REVIEW

[논문 리뷰] ChatGPT vs Human-authored Text: Insights into Controllable Text Summarization and Sentence Style Transfer

Dongqi Pu, Vera Demberg|arXiv (Cornell University)|2023. 06. 13.
Topic Modeling인용 수 5
한 줄 요약

이 연구는 전문가 대상 및 초보자 대상 요약 및 공식 어조에서 비공식 어조로의 문장 스타일 전이를 포함한 제어된 텍스트 생성에서 ChatGPT의 성능을 평가한다. 자동 평가 지표에서는 이전 모델보다 뛰어난 성능을 보였지만, 스타일, 의미론적 정확성 및 사실 일관성 측면에서 인간이 작성한 텍스트와는 크게 다름을 발견하였으며, 특히 스타일 전이 과정에서 심각한 환각 현상과 의미론적 이탈이 발생함을 확인하였다.

ABSTRACT

Large-scale language models, like ChatGPT, have garnered significant media attention and stunned the public with their remarkable capacity for generating coherent text from short natural language prompts. In this paper, we aim to conduct a systematic inspection of ChatGPT's performance in two controllable generation tasks, with respect to ChatGPT's ability to adapt its output to different target audiences (expert vs. layman) and writing styles (formal vs. informal). Additionally, we evaluate the faithfulness of the generated text, and compare the model's performance with human-authored texts. Our findings indicate that the stylistic variations produced by humans are considerably larger than those demonstrated by ChatGPT, and the generated texts diverge from human samples in several characteristics, such as the distribution of word types. Moreover, we observe that ChatGPT sometimes incorporates factual errors or hallucinations when adapting the text to suit a specific style.

연구 동기 및 목표

  • 다른 청중(전문가 대비 일반인)과 글쓰기 스타일(공식 대비 비공식)에 맞추어 텍스트를 생성할 수 있는 ChatGPT의 능력을 체계적으로 평가하기 위해.
  • 인간이 작성한 텍스트와 비교하여 ChatGPT가 생성한 텍스트의 충실도와 의미론적 정확도를 평가하기 위해.
  • 모델이 생성한 텍스트와 인간이 작성한 텍스트 사이의 스타일, 구조, 사실적 특성에서의 격차를 규명하고 정량화하기 위해.
  • 특히 스타일 전이 과정에서 환각 현상과 의미론적 일관성 없는 내용이 발생할 위험을 조사하기 위해.
  • 모델 출력을 인간 기준과 비교하여 향후 LLM의 제어된 텍스트 생성 연구를 위한 기준을 제공하기 위해.

제안 방법

  • 공개된 두 데이터셋을 사용: 문서 수준 요약을 위한 QMSum, 문장 수준의 스타일 전이를 위한 GYAFC.
  • 프롬프트 엔지니어링을 적용하여 ChatGPT를 목표 청중(전문가/일반인)과 스타일(공식/비공식)에 따라 조건화하여 두 작업 모두 수행.
  • 요약 품질 평가를 위해 ROUGE, BERTScore, 독해 난이도(Flesch-Kincaid)와 같은 자동 평가 지표를 사용.
  • 불필요한 의존 관계 간선을 탐지하기 위해 종속성 궤적 함의성 분석(Dependency Arc Entailment, DAE)을 적용하여 사실 일관성 없는 내용을 파악.
  • 스틸 전이 결과에 대해 질적 사례 연구를 수행하여 언어학적 및 의미론적 분석을 통해 인간 기준과 비교.
  • 의미 보존 및 스타일 정확도 평가를 위해 인간이 주석 처리한 기준 텍스트를 황금 표준으로 사용.
Figure 1: Comparison of abstractiveness between ChatGPT and human-generated summaries
Figure 1: Comparison of abstractiveness between ChatGPT and human-generated summaries

실험 결과

연구 질문

  • RQ1ChatGPT의 학술 문서 요약 성능은 독해 난이도와 내용 충실도 측면에서 전문가 대상과 일반인 대상 간에 어떻게 다를까?
  • RQ2ChatGPT는 핵심 의미를 변경하지 않고 공식어에서 비공식어, 또는 그 반대로 문장 스타일을 성공적으로 전이할 수 있는가?
  • RQ3ChatGPT가 생성한 텍스트의 스타일, 문법, 어휘적 특성은 인간이 작성한 텍스트와 어떻게 다를까?
  • RQ4스타일 전이 및 요약 과제에서 ChatGPT 출력 내 사실 환각 현상과 의미론적 일관성 없는 내용의 비율은 어느 정도일까?
  • RQ5원하는 글쓰기 스타일의 예시를 제공하면 ChatGPT와 인간이 생성한 텍스트 간의 성능 격차를 줄일 수 있는가?

주요 결과

  • ChatGPT가 생성한 요약은 인간이 작성한 요약과 비교해 어휘 다양성과 문법 복잡성 측면에서 스타일적 다양성이著격히 낮다.
  • 문장 수준의 스타일 전이 과정에서 약 18%의 ChatGPT 출력에서 핵심 어휘가 잘못되거나 변경된 의미론적 일관성 없는 내용이 확인되었다.
  • 의존성 트리 분석 결과, ChatGPT가 생성한 텍스트는 인간이 작성한 텍스트보다 더 많은 불필요한 의존성 간선을 포함하고 있어 사실의 이탈을 시사한다.
  • ChatGPT는 특히 비공식어에서 공식어로의 변환 과정에서 사실 오류나 환각 현상을 자주 유발한다.
  • ROUGE, BERTScore 등의 자동 평가 지표에서 높은 성능을 보였지만, 이러한 지표들은 출력 내 의미론적 일관성 문제와 사실 오류를 탐지하지 못했다.
  • 원하는 글쓰기 스타일의 예시를 제공함으로써 ChatGPT와 인간이 생성한 텍스트 간의 성능 격차가 줄어들었으며, 이는 스타일 조건화가 정렬을 향상시킬 수 있음을 시사한다.
Figure 2: Summary consistency detection. L stands for layman, E for expert.
Figure 2: Summary consistency detection. L stands for layman, E for expert.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.