[論文レビュー] When Automated Assessment Meets Automated Content Generation: Examining Text Quality in the Era of GPTs
本研究では、人間が書いたテキストで訓練された機械学習(ML)ベースのエッセイ採点モデルが、GPTが生成したテキストをどのように評価するかを評価するフレームワークを提案する。6つのジャンルにわたる18,460編の人工的およびGPT生成エッセイを用いて分析した結果、BERTのようなトランスフォーマー型モデルは、人間のエッセイよりもGPT生成テキストを10–15%高く評価していることが判明した。これは、人間データでのファインチューニングのみを経ているにもかかわらず、予測データの重複に起因する可能性が大きい。生成AIの普及に伴い、自動テキスト評価におけるリスクが浮き彫りになった。
The use of machine learning (ML) models to assess and score textual data has become increasingly pervasive in an array of contexts including natural language processing, information retrieval, search and recommendation, and credibility assessment of online content. A significant disruption at the intersection of ML and text are text-generating large-language models such as generative pre-trained transformers (GPTs). We empirically assess the differences in how ML-based scoring models trained on human content assess the quality of content generated by humans versus GPTs. To do so, we propose an analysis framework that encompasses essay scoring ML-models, human and ML-generated essays, and a statistical model that parsimoniously considers the impact of type of respondent, prompt genre, and the ML model used for assessment model. A rich testbed is utilized that encompasses 18,460 human-generated and GPT-based essays. Results of our benchmark analysis reveal that transformer pretrained language models (PLMs) more accurately score human essay quality as compared to CNN/RNN and feature-based ML methods. Interestingly, we find that the transformer PLMs tend to score GPT-generated text 10-15\% higher on average, relative to human-authored documents. Conversely, traditional deep learning and feature-based ML models score human text considerably higher. Further analysis reveals that although the transformer PLMs are exclusively fine-tuned on human text, they more prominently attend to certain tokens appearing only in GPT-generated text, possibly due to familiarity/overlap in pre-training. Our framework and results have implications for text classification settings where automated scoring of text is likely to be disrupted by generative AI.
研究の動機と目的
- 人間が書いたエッセイで訓練された機械学習(ML)ベースの自動エッセイ採点(AES)モデルが、GPTが生成したテキストをどのように評価するかを調査すること。
- エッセイのジャンルとモデルアーキテクチャの影響が、人間とGPT生成テキストの採点差異にどのように作用するかを分析すること。
- MLスコアリングの文脈において、人間とGPT生成エッセイを区別するための言語的キューおよび注目パターンを特定すること。
- 自然言語処理における自動コンテンツ生成と自動評価の交差点を研究する再現可能なフレームワークを構築すること。
- AI生成コンテンツに偏る自動採点システムのリスクについて、人間データに限定して訓練された場合でも実証的洞察を提供すること。
提案手法
- 本研究では、6つのジャンルにわたる68のプロンプトを用いて、15,437編の人工的生成エッセイと3,023編のGPT生成エッセイ(GPT-3.5が1,537編、GPT-4が1,486編)を含む、豊富なテストベッドを構築した。
- BERT、RoBERTa、CNN/RNN、および特徴ベースのモデルを含む最新のMLモデルを用いて、人間およびGPT生成エッセイの両方をスコア付けした。
- 著者性(人間対GPT)、プロンプトジャンル、スコアリングモデルアーキテクチャの主効果および相互作用を統合的に分析するための統計的モデルを用いた。
- 並列的表現分析を実施し、トピック、感情、品詞、綴りの誤りなどの言語的特徴を、人間生成テキストとGPT生成テキストの間で比較した。
- BERTベースのモデルにおける注目重み分析を実施し、GPT生成エッセイと人間生成エッセイをスコアリングする際のモデルの注目対象となるトークンを検証した。
- フレームワーク、コード、データ、プロンプト設計はGitHubを通じて公開され、再現性と今後の研究を支援する。

実験結果
リサーチクエスチョン
- RQ1RQ1: 最新の特徴ベースおよびディープラーニングモデルは、自動エッセイ採点(AES)においてどの程度有効であるか?
- RQ2RQ2: 人間生成コンテンツで訓練されたAESモデルは、GPTモデルが生成したテキストをどの程度評価するか。また、ドキュメントジャンルがその評価に与える調節効果は何か?
- RQ3RQ3: 人間とGPT生成テキストの間で最も異なる言語的カテゴリーとキューは何か。これらの差異は、モデルの注目パターンと採点にどのように影響するか?
主な発見
- トランスフォーマー型モデル(BERTやRoBERTa)は、CNN/RNNおよび特徴ベースのモデルよりも人間エッセイの質をよりよくスコアリングしており、テキスト分類分野における最新技術の妥当性を裏付けている。
- 人間エッセイでのファインチューニングのみを経ているにもかかわらず、BERTベースのモデルはGPT-3.5が生成したテキストを平均して人間エッセイよりも約15%高く評価している。
- これに対して、特徴ベースおよびCNN/RNNモデルは、GPT生成テキストよりも人間エッセイをそれぞれ10–15%および26–32%高く評価しており、顕著なモデル依存バイアスが存在することが示された。
- 採点差異は、BERTモデルにおける注目パターンと関連しており、その中で、事前学習データとGPT生成テキストの両方に登場する固有名詞(例:著者名や登場人物名)に注目が集まっていることが判明した。
- 言語的分析から、トピック、感情、品詞、綴りの誤りにおいて、GPTと人間エッセイの差異は、人間ユーザー生成コンテンツにおける性別や人種の差異よりも顕著であることが明らかになった。
- これらの発見は、BERT/RoBERTaとGPTモデルの間で事前学習データの重複があることが、前者がGPT生成テキストを好む要因となっている可能性を示唆しており、モデルが明示的にそのようなコンテンツで訓練されていなくても同様の傾向が見られる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。