[論文レビュー] Evaluating AI and Human Authorship Quality in Academic Writing through Physics Essays
本研究では、人間とGPT-4で生成された短い物理学エッセイをそれぞれ150編ずつ、盲検による共同評価で評価した。その結果、質の差に統計的に有意な差は認められなかった(p = 0.107)。人間の判断精度はわずかにランダムより高い水準にとどまり、ZeroGPTはAI文書の検出において98%の正確性を示した。著者らは、AI統合と学術的誠実性を両立させる観点から、AIコンテンツの割合が50%未満である場合を、人間が執筆したと分類する実用的境界と提案する。
This study evaluates $n = 300$ short-form physics essay submissions, equally divided between student work submitted before the introduction of ChatGPT and those generated by OpenAI's GPT-4. In blinded evaluations conducted by five independent markers who were unaware of the origin of the essays, we observed no statistically significant differences in scores between essays authored by humans and those produced by AI (p-value $= 0.107$, $α$ = 0.05). Additionally, when the markers subsequently attempted to identify the authorship of the essays on a 4-point Likert scale - from `Definitely AI' to `Definitely Human' - their performance was only marginally better than random chance. This outcome not only underscores the convergence of AI and human authorship quality but also highlights the difficulty of discerning AI-generated content solely through human judgment. Furthermore, the effectiveness of five commercially available software tools for identifying essay authorship was evaluated. Among these, ZeroGPT was the most accurate, achieving a 98% accuracy rate and a precision score of 1.0 when its classifications were reduced to binary outcomes. This result is a source of potential optimism for maintaining assessment integrity. Finally, we propose that texts with $\leq 50\%$ AI-generated content should be considered the upper limit for classification as human-authored, a boundary inclusive of a future with ubiquitous AI assistance whilst also respecting human-authorship.
研究の動機と目的
- AI生成エッセイが物理学的文脈において人間が執筆したエッセイと同等の質を有するかどうかを評価すること。
- 人間の採点者が学術的作文においてAIと人間の著作者を区別できるかを評価すること。
- 商業的AI検出ツールが学術的エッセイにおけるAI生成コンテンツを同定する効果的さを検証すること。
- 人間が執筆した学術的作業において許容可能なAIコンテンツの割合を実用的基準として確立すること。
- 学術的誠実性を保ちながら、高等教育におけるAI利用に関する教育政策を示唆すること。
提案手法
- 著者情報が不明な5名の独立した採点者が、人間が150編、GPT-4で生成されたものが150編の短い物理学エッセイ(全300編)を盲検評価した。
- エッセイは、物理学の成績評価(形成的および総合的評価)から抽出され、物理学の歴史、哲学、倫理に関するトピックを含んでいた。
- 採点者は標準化された基準に従い、学術的質を評価し、著者情報は評価後、バイアスを避けるために割り当てられた。
- その後のタスクでは、採点者が各エッセイを「確かにAI生成」、「おそらくAI生成」、「おそらく人間生成」、「確かに人間生成」という4段階のリッカート尺度で分類するよう求められた。
- ZeroGPTを含む5種類の商業的AI検出ツールが、AI生成コンテンツを同定する正確性について評価された。
- 人間が執筆したと分類するための実用的境界として、AI生成コンテンツの割合が50%未満であることが提案された。
実験結果
リサーチクエスチョン
- RQ1AI生成と人間が執筆した物理学エッセイの質に、統計的に有意な差があるか?
- RQ2盲検状態において、人間の採点者がAI生成と人間生成の学術的エッセイを信頼性高く区別できるか?
- RQ3商業的に利用可能なAI検出ツールは、学術的エッセイにおけるAI生成コンテンツをどれほど効果的に同定できるか?
- RQ4人間が執筆した学術的作業において、著作者の誠実性を損なわずに許容できるAI生成コンテンツの割合はどの程度か?
- RQ5高等教育におけるAI支援と学術的誠実性の両立を図るための政策的ガイドラインはどのようなものか?
主な発見
- 人間が執筆したエッセイとAI生成エッセイの質に、統計的に有意な差は認められなかった(p = 0.107、α = 0.05)。
- 人間の採点者がAI著作者を特定する能力は、ランダムよりわずかに高い水準にとどまり、50%を有意に上回っていなかった。
- ZeroGPTは、二値分類に還元した場合、AI生成コンテンツの検出において98%の正確性と1.0の適合率(precision)を示した。
- 本研究では、AI生成エッセイが物理学の歴史的・哲学的トピックの範囲において、内容、構成、学術的厳密性の面で人間の水準に達していることが判明した。
- 商業的リライトツールは検出回避に効果を示さず、AI検出システムを回避するには人間による編集が必要であることが示された。
- 著者らは、AI生成コンテンツの割合が50%未満の作品は、人間が執筆したと分類すべきであり、将来的な学術的作業における実用的かつ包括的な基準として提示する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。