Skip to main content
QUICK REVIEW

[論文レビュー] ChatGPT v Bard v Bing v Claude 2 v Aria v human-expert. How good are AI chatbots at scientific writing?

Edisa Lozić, Benjamin Štular|arXiv (Cornell University)|Sep 14, 2023
Artificial Intelligence in Healthcare and Education参考文献 57被引用数 4
ひとこと要約

本研究では、人文学および考古学分野における科学的ライティングにおいて、ChatGPT-4、ChatGPT-3.5、Bing、Bard、Claude 2、Aria の6つのAIチャットボットを人間の専門家と比較評価した。事実の正確性の定量的評価と、科学的貢献の定性的分析を用いて、ChatGPT-4が最高の正確性を示した一方、すべてのAIは独自の科学的コンテンツを生成できず、学術的ライティングにおける人間の独創性を再現する能力に根強い制限があることが明らかになった。

ABSTRACT

Historical emphasis on writing mastery has shifted with advances in generative AI, especially in scientific writing. This study analysed six AI chatbots for scholarly writing in humanities and archaeology. Using methods that assessed factual correctness and scientific contribution, ChatGPT-4 showed the highest quantitative accuracy, closely followed by ChatGPT-3.5, Bing, and Bard. However, Claude 2 and Aria scored considerably lower. Qualitatively, all AIs exhibited proficiency in merging existing knowledge, but none produced original scientific content. Inter-estingly, our findings suggest ChatGPT-4 might represent a plateau in large language model size. This research emphasizes the unique, intricate nature of human research, suggesting that AI's emulation of human originality in scientific writing is challenging. As of 2023, while AI has transformed content generation, it struggles with original contributions in humanities. This may change as AI chatbots continue to evolve into LLM-powered software.

研究の動機と目的

  • 人文学および考古学の文脈における主要なAIチャットボットの科学的ライティングの質を評価すること。
  • 人間の専門家と比較して、AIが生成するコンテンツの事実の正確性と科学的貢献を評価すること。
  • 大規模言語モデルが独自の科学的知見を生み出すことができるのか、それとも既存の知識の単なる統合にとどまるのかを調査すること。
  • モデルサイズの増大に伴い性能が飽和する傾向があるかどうか、特にGPT-4においてを調査すること。
  • 現在のAIが、学術的研究における人間の独創性と深さを模倣する能力に、どのような限界を示しているかを理解すること。

提案手法

  • 本研究では、人文学および考古学分野における標準化された科学的ライティングタスクを用いた比較評価フレームワークを採用した。
  • 事実の正確性は、AIの出力結果を基準データおよび専門家が検証済みの出典と照合することで定量的に測定した。
  • 科学的貢献は、独自性、一貫性、方法論の妥当性に注目した専門家による定性的なレビューを通じて評価した。
  • 評価には、ChatGPT-4、ChatGPT-3.5、Bing、Bard、Claude 2、Aria の5つのAIモデルに加え、人間の専門家の回答をベンチマークとして用いた。
  • 主要な発見を明確かつ分かりやすく要約するため、図版の要約とハイライトを用いた。
  • 結果の検証と広報のため、査読付きオープンアクセスの学術誌を用いた。

実験結果

リサーチクエスチョン

  • RQ1異なるAIチャットボットは、人文学および考古学分野における科学的コンテンツを生成する際、どの程度の事実の正確性を示すか?
  • RQ2AIチャットボットは、既存の知識の単なる統合にとどまらず、どの程度独自の科学的貢献を可能にするか?
  • RQ3大規模言語モデルのパフォーマンスは、GPT-4の段階で飽和しているのか、それとも新しいモデルが顕著な改善を示すのか?
  • RQ4AIモデルの科学的ライティングの質は、学術分野における人間の専門家と比べてどの程度か?
  • RQ5現在のAIが、科学的ライティングにおける人間の研究の深さと独創性を再現する上で、根強い限界は何か?

主な発見

  • ChatGPT-4は、評価されたすべてのAIモデルの中で、事実の正確性において最も高い定量的正確性を示した。
  • ChatGPT-3.5、Bing、Bardは、ChatGPT-4に次いで事実の正確性で高く評価され、上位クラスのモデルとしての強力なパフォーマンスを示した。
  • Claude 2とAriaは、事実の正確性において顕著に低いスコアを記録し、主要なLLM間でのパフォーマンス格差が明らかになった。
  • すべてのAIモデルは、既存の知識を統合・再表現する能力に優れていたが、独自の科学的知見を生成することはできなかった。
  • 本研究では、ChatGPT-4が大規模言語モデルの能力に到達したパフォーマンスの飽和点を示している可能性が示唆された。モデルサイズの増大に伴うリターンの減少が見られた。
  • 人間の専門家は、独自で概念的に新規な科学的コンテンツを生み出す点で、依然として他に代えがたい存在であり、学術的研究における人間の独創性の不可欠な役割が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。