[論文レビュー] What has ChatGPT read? The origins of archaeological citations used by a generative artificial intelligence application
本研究は、クローズ分析を用いて、ChatGPTが訓練段階で真正の学術的文献にアクセスしたかどうかを評価する目的で、考古学的引用の出どころを調査した。その結果、ChatGPTが妥当な引用を提示するが、大多数は架空のものであることが判明した。真正の引用は、オリジナルの文献ではなく、Wikipedia からのものである可能性が高く、AIが生成する学術的コンテンツにおけるデータ品質と信頼性に懸念が生じる。
The public release of ChatGPT has resulted in considerable publicity and has led to wide-spread discussion of the usefulness and capabilities of generative AI language models. Its ability to extract and summarise data from textual sources and present them as human-like contextual responses makes it an eminently suitable tool to answer questions users might ask. This paper tested what archaeological literature appears to have been included in ChatGPT's training phase. While ChatGPT offered seemingly pertinent references, a large percentage proved to be fictitious. Using cloze analysis to make inferences on the sources 'memorised' by a generative AI model, this paper was unable to prove that ChatGPT had access to the full texts of the genuine references. It can be shown that all references provided by ChatGPT that were found to be genuine have also been cited on Wikipedia pages. This strongly indicates that the source base for at least some of the data is found in those pages. The implications of this in relation to data quality are discussed.
研究の動機と目的
- ChatGPTが提示する考古学的引用の出どころを特定すること。
- ChatGPTが訓練段階で真正の学術的資料の本文をアクセスしたかどうかを評価すること。
- 学術的および文化財分野におけるAI生成引用の信頼性を評価すること。
- Wikipedia が考古学および文化財分野におけるChatGPTの訓練データの主要な出どころであるかどうかを調査すること。
提案手法
- ChatGPTが参照断片を完成できる能力に基づき、どのソースが『記憶』されたかを推定するクローズ分析を実施した。
- 考古学および文化財管理分野の既知の学術文献と照合して、ChatGPTが生成した引用を収集・照合した。
- 学術データベース(例:JSTOR)、Google ブックス、Archive.org での存在確認により、引用の真正性を検証した。
- データのルートを特定するために、引用ソースとWikipediaページの引用を比較した。
- 複数のトピックおよびモデルバージョンに対して繰り返しクエリを実施し、出力の一貫性と信頼性をテストした。
- 560件の引用にわたる、著者、題名、発表年、出典の整合性を評価することで、引用の正確性を分析した。
実験結果
リサーチクエスチョン
- RQ1ChatGPTが生成する考古学的引用のうち、事実に基づいたものと架空のものの割合はどの程度か?
- RQ2考古学的引用の訓練データとして最も寄与している可能性があるソースは何か?
- RQ3ChatGPTが真正の引用を提示する場合、それらがWikipediaのページに記載されているかどうか。これは、Wikipediaから学習した可能性を示唆する。
- RQ4ChatGPTが訓練段階で、引用された学術的文献の本文にアクセスしたと見なせる程度はどの程度か?
- RQ5繰り返しクエリや複数のモデルバージョンにおいて、ChatGPTの引用はどの程度一貫しているか?
主な発見
- 分析対象の560件の引用のうち、48.8%が事実誤認(架空の引用)であり、AI生成引用における高頻度の「幻覚」を示している。
- 著者、題名、発表年が正しい引用は全体の32.1%にとどまった。
- ChatGPTが提示した真正の引用は、すべて対応するWikipediaページに記載されていたため、Wikipedia が訓練データとしての可能性が極めて高いと示唆された。
- 訓練段階で真正の学術的文献の本文にアクセスした証拠は一切得られなかった。
- オーストラリア考古学分野では、84.5%の引用が事実誤認であり、特に高い誤り率を示した。
- 繰り返しクエリにおいても、モデルは一貫した引用ミスを示し、再生成された出力はしばしば異なるが同様に不正確な引用を生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。