Skip to main content
QUICK REVIEW

[論文レビュー] Contrasting Linguistic Patterns in Human and LLM-Generated News Text

Alberto Muñoz-Ortiz, Carlos Gómez‐Rodríguez|arXiv (Cornell University)|Aug 17, 2023
Natural Language Processing Techniques参考文献 32被引用数 5
ひとこと要約

本研究では、LLaMAファミリーのモデルを用いて、人間が執筆した英語のニュース記事とLLMが生成したニュース記事を対比し、形態句構造的、心理的、社会的言語的次元における言語的パターンを分析した。高水準の流暢さを示す一方で、LLMはより客観的な言語を用い、構成要素が短く、攻撃的でない感情(恐怖、嫌悪)が減少し、人称代名詞の使用頻度が高くなる。また、特に大規模モデルでは、人間らしい性別バイアスを反映し、それらを強化する傾向がある。

ABSTRACT

We conduct a quantitative analysis contrasting human-written English news text with comparable large language model (LLM) output from six different LLMs that cover three different families and four sizes in total. Our analysis spans several measurable linguistic dimensions, including morphological, syntactic, psychometric, and sociolinguistic aspects. The results reveal various measurable differences between human and AI-generated texts. Human texts exhibit more scattered sentence length distributions, more variety of vocabulary, a distinct use of dependency and constituent types, shorter constituents, and more optimized dependency distances. Humans tend to exhibit stronger negative emotions (such as fear and disgust) and less joy compared to text generated by LLMs, with the toxicity of these models increasing as their size grows. LLM outputs use more numbers, symbols and auxiliaries (suggesting objective language) than human texts, as well as more pronouns. The sexist bias prevalent in human text is also expressed by LLMs, and even magnified in all of them but one. Differences between LLMs and humans are larger than between LLMs.

研究の動機と目的

  • 大規模言語モデル(LLM)であるLLaMAが、人間が執筆したニュース記事の言語的パターンを再現するかどうかを調査すること。
  • 人間とAIが生成したニュース記事の間で、形態句構造的、心理的、社会的言語的特徴に顕著な差が生じるかどうかを特定すること。
  • モデルサイズが人間の言語的基準からの乖離度に与える影響を評価すること。
  • 人間のバイアス(特に性別バイアス)が、LLMが生成するコンテンツにどのように残留するかを評価すること。
  • 言語的プロファイルを用いた合成テキストの検出に向けた、制御された新規ベンチマークを確立すること。

提案手法

  • LLaMAモデルのリリース日以降に公開されたニュース記事の見出しと導入部に焦点を当て、New York Times APIから11,133件の人工的ニュース記事を収集した。データ漏洩を防ぐために、この期間以降のデータを選定した。
  • 人間の見出しと導入文に基づいてLLaMAモデルを用いてニュースコンテンツを生成し、トレーニングデータからの記憶を避けるようにした。
  • 語彙使用、文の長さ、品詞(Part-of-Speech, PoS)分布、依存構造および構成要素構造、感情トーン、および人称代名詞の使用や性別バイアスを含む社会的言語的特徴など、複数の言語的次元で定量的分析を実施した。
  • 標準化されたNLPツールを用いて、構文解析(依存木および構成要素木)、感情検出(例:恐怖、嫌悪)、バイアス測定(例:人称代名詞頻度、性別に偏った言語)を実施した。
  • モデルサイズの違いに応じた言語的乖離度の変化を評価するために、異なるサイズのLLaMAモデル間で結果を比較した。
  • 信頼できるニュースソースから制御されたリアルタイムのデータを用いることで、新鮮さを確保するとともに、記憶のリスクを最小限に抑えた。
Figure 1: We gather contemporary articles from the New York Times API and use their headlines as a prompt to produce LLaMa-generated news. We then compare both types of texts, measuring differences across aspects such as vocabulary, morphosyntactic structures, and semantic attributes.
Figure 1: We gather contemporary articles from the New York Times API and use their headlines as a prompt to produce LLaMa-generated news. We then compare both types of texts, measuring differences across aspects such as vocabulary, morphosyntactic structures, and semantic attributes.

実験結果

リサーチクエスチョン

  • RQ1LLMが生成したニューステキストは、人間が執筆したニュース記事と比較して、統計的に有意な構文的構造の違いを示すか?
  • RQ2LLMは、恐怖や嫌悪といった否定的感情のトーンにおいて、人間とどのように異なるか?
  • RQ3LLMは、人間のテキストに見られる性別に偏った人称代名詞の使用といった社会的言語的バイアスをどの程度再現または強化するか?
  • RQ4モデルサイズは、人間とLLMが生成するニュースの言語的乖離度にどのように影響するか?
  • RQ5人間とAIが生成するニュースの間で、語彙の多様性、記号/数字の使用頻度、助動詞の使用頻度に測定可能な差が生じるか?

主な発見

  • 人間が執筆したニュース記事は、LLMが生成したテキストに比べて、文の長さの分布がより散らばっている。
  • LLaMAモデルは、人間のテキストと比較して、数字、記号、助動詞を顕著に多く使用しており、これは客観的で形式的な言語を好む傾向を示している。
  • LLMが生成したテキストは、人間が執筆したニュース記事と比較して、構成要素のスパンが短く、依存構造および構成要素の種類の分布が顕著に異なる。
  • 高い流暢さを示す一方で、LLMは人間のテキストほど攻撃的でない否定的感情(例:恐怖、嫌悪)を表現していないが、モデルサイズが大きくなるほどこの傾向が強まる。
  • LLaMAモデルは、人間のテキストと比較して、男性を指す人称代名詞の頻度が顕著に高い。これは、トレーニングデータに既存する性別バイアスを反映し、それらを強化している。
  • 本研究は、非常に流暢なLLMであっても、言語的特徴が明確に異なる出力を生成することを確認した。これにより、言語的プロファイルを用いた検出が可能になる。
Figure 2: Sentence length distribution for the human- and LLaMa-generated texts.
Figure 2: Sentence length distribution for the human- and LLaMa-generated texts.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。