Skip to main content
QUICK REVIEW

[논문 리뷰] Contrasting Linguistic Patterns in Human and LLM-Generated News Text

Alberto Muñoz-Ortiz, Carlos Gómez‐Rodríguez|arXiv (Cornell University)|2023. 08. 17.
Natural Language Processing Techniques참고 문헌 32인용 수 5
한 줄 요약

이 연구는 LLaMA 계열 모델을 사용하여 인간이 작성한 뉴스 기사와 LLM이 생성한 영문 뉴스 기사 간의 언어 패턴을 모로시나틱, 심리측정적, 사회언어학적 차원에서 비교 분석한다. 높은 유창성에도 불구하고 LLM은 더 객관적인 언어를 사용하고, 구성요소가 더 짧으며, 공격적인 정서(공포, 혐오)가 감소하고, 더 높은 빈도로 대명사를 사용한다. 또한 인간이 가진 성별 편향을 반영하고 심지어 증폭시키며, 특히 더 큰 모델일수록 두드러진다.

ABSTRACT

We conduct a quantitative analysis contrasting human-written English news text with comparable large language model (LLM) output from six different LLMs that cover three different families and four sizes in total. Our analysis spans several measurable linguistic dimensions, including morphological, syntactic, psychometric, and sociolinguistic aspects. The results reveal various measurable differences between human and AI-generated texts. Human texts exhibit more scattered sentence length distributions, more variety of vocabulary, a distinct use of dependency and constituent types, shorter constituents, and more optimized dependency distances. Humans tend to exhibit stronger negative emotions (such as fear and disgust) and less joy compared to text generated by LLMs, with the toxicity of these models increasing as their size grows. LLM outputs use more numbers, symbols and auxiliaries (suggesting objective language) than human texts, as well as more pronouns. The sexist bias prevalent in human text is also expressed by LLMs, and even magnified in all of them but one. Differences between LLMs and humans are larger than between LLMs.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)인 LLaMA가 인간이 작성한 뉴스 기사의 언어 패턴을 재현하는지 조사하기 위해.
  • 인간과 AI가 생성한 뉴스 기사 간의 형태구문, 심리측정, 사회언어학적 특성에서 측정 가능한 차이를 규명하기 위해.
  • 모델 크기가 인간 언어 기준과의 언어적 이질성 정도에 미치는 영향을 평가하기 위해.
  • 성별 편향과 같은 인간의 편향이 LLM이 생성한 콘텐츠에 어떻게 유지되는지 평가하기 위해.
  • 언어적 프로파일링을 활용한 합성 텍스트 탐지의 통제된, 새로운 벤치마크를 설정하기 위해.

제안 방법

  • LLaMA 모델 출시 일자 이후에 발표된 뉴스 기사의 제목과 서론 문단에 중점을 두고 뉴욕타임스 API를 통해 11,133건의 인간 작성 기사를 수집하였다. 이는 데이터 泄露를 방지하기 위함이다.
  • LLaMA 모델을 사용해 인간의 제목과 서론 문장을 기반으로 뉴스 기사를 생성하였으며, 훈련 데이터에서 기억된 바가 없도록 하였다.
  • 어휘 사용, 문장 길이, 품사(PoS) 분포, 의존구조 및 구성요소 구조, 정서 톤, 대명사 사용 및 성별 편향을 포함한 사회언어학적 특성 등 여러 언어적 차원에서 정량적 분석을 수행하였다.
  • 구문 분석(의존구조 및 구성요소 트리), 정서 탐지(예: 공포, 혐오), 편향 측정(예: 대명사 빈도, 성별 언어)을 위한 표준화된 NLP 도구를 사용하였다.
  • 다양한 크기의 LLaMA 모델 간 비교를 통해 언어적 이질성에 대한 스케일링 효과를 평가하였다.
  • 신뢰할 수 있는 뉴스 소스에서 실시간으로 수집한 통제된 데이터를 사용하여 최신성 확보 및 기억화 위험 최소화를 달성하였다.
Figure 1: We gather contemporary articles from the New York Times API and use their headlines as a prompt to produce LLaMa-generated news. We then compare both types of texts, measuring differences across aspects such as vocabulary, morphosyntactic structures, and semantic attributes.
Figure 1: We gather contemporary articles from the New York Times API and use their headlines as a prompt to produce LLaMa-generated news. We then compare both types of texts, measuring differences across aspects such as vocabulary, morphosyntactic structures, and semantic attributes.

실험 결과

연구 질문

  • RQ1LLM이 생성한 뉴스 기사가 인간이 작성한 뉴스 기사와 비교해 통계적으로 유의미한 문법적 구조의 차이를 보이는가?
  • RQ2LLM은 인간과 비교해 공격적인 부정 정서(예: 공포, 혐오)를 어떻게 다루는가?
  • RQ3LLM은 인간 기사에 나타나는 성별 언어 사용과 같은 사회언어학적 편향을 어느 정도 재현하거나 증폭시키는가?
  • RQ4모델 크기가 인간과 LLM이 생성한 뉴스 간 언어적 이질성에 어떤 영향을 미치는가?
  • RQ5인간과 AI가 생성한 뉴스 기사 간 어휘 다양성, 기호/숫자 사용, 보조 동사 사용에 측정 가능한 차이가 있는가?

주요 결과

  • 인간이 작성한 뉴스 기사의 문장 길이 분포는 LLM이 생성한 기사의 더 균일한 분포와는 대비되며, 더 산재해 있다.
  • LLaMA 모델은 인간 기사보다 유의미하게 더 많은 숫자, 기호, 보조 동사를 사용하며, 이는 객관적이고 형식적인 언어를 선호함을 시사한다.
  • LLM이 생성한 텍스트는 인간이 작성한 뉴스 기사와는 달리 더 짧은 구성요소 길이와 의존구조 및 구성요소 유형의 고유한 분포를 보인다.
  • 높은 유창성에도 불구하고 LLM은 인간 기사보다 공격적인 부정 정서(예: 공포, 혐오)를 덜 표현하지만, 이 경향은 모델 크가 증가함에 따라 강화된다.
  • LLaMA 모델은 인간 기사보다 남성 대명사 사용 빈도가 더 높으며, 이는 훈련 데이터에 존재하는 기존의 성별 편향을 반영하고 증폭시키고 있음을 보여준다.
  • 연구는 매우 유창한 LLM이라도 언어적으로 구별되는 출력을 생성함을 확인하였으며, 언어적 프로파일링을 통해 이의 탐지 가능성을 시사한다.
Figure 2: Sentence length distribution for the human- and LLaMa-generated texts.
Figure 2: Sentence length distribution for the human- and LLaMa-generated texts.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.