Skip to main content
QUICK REVIEW

[論文レビュー] Judgments of research co-created by generative AI: experimental evidence

Paweł Niszczota, Paul Conway|arXiv (Cornell University)|May 3, 2023
Artificial Intelligence in Healthcare and EducationMedicine被引用数 3
ひとこと要約

本実験的研究では、生成的AIと共同して研究を行う際の一般の人々の認識を調査し、大規模言語モデル(LLM)にタスクを委ねる科学者に対しては、人間の博士課程学生に委ねる場合と比較して、道徳的受容性が低く、信頼性が低く、品質も低いと判断される傾向があることが明らかになった。主な結果として、AI支援研究に対する顕著な否定的バイアスが認められ、道徳的受容性、信頼性、および認識される品質の各分野で、効果量はd = -0.78からd = -0.85の範囲にわたる。

ABSTRACT

The introduction of ChatGPT has fuelled a public debate on the use of generative AI (large language models; LLMs), including its use by researchers. In the current work, we test whether delegating parts of the research process to LLMs leads people to distrust and devalue researchers and scientific output. Participants (N=402) considered a researcher who delegates elements of the research process to a PhD student or LLM, and rated (1) moral acceptability, (2) trust in the scientist to oversee future projects, and (3) the accuracy and quality of the output. People judged delegating to an LLM as less acceptable than delegating to a human (d = -0.78). Delegation to an LLM also decreased trust to oversee future research projects (d = -0.80), and people thought the results would be less accurate and of lower quality (d = -0.85). We discuss how this devaluation might transfer into the underreporting of generative AI use.

研究の動機と目的

  • 生成的AIに研究タスクを委ねることにより、研究者およびその研究に対する否定的評価が生じるかどうかを検討すること。
  • 道徳的受容性、信頼性、認識される品質の観点から、AI支援研究と人間支援研究の一般の認識を比較すること。
  • このようなバイアスが、学術的研究におけるAI使用の報告不足を引き起こす可能性があるかどうかを調査すること。
  • LLMを学術的ワークフローに統合する心理的および社会的影響を理解すること。

提案手法

  • 402名の参加者を対象に、研究プロセスの一部を博士課程学生か大規模言語モデル(LLM)に委ねた研究者についての判断を評価する実験的研究を実施した。
  • 参加者が研究の道徳的受容性、信頼性、および研究結果の正確性/品質を評価する、制御されたシナリオベースの設計を採用した。
  • 道徳的受容性、監視に対する信頼性、結果の正確性および品質に関する標準化された評価尺度を用いた。
  • Cohenのd効果量を計算して、AIと人間の委ねる条件の間での判断の差を定量化した。
  • 被験者内および被験者間比較を用いて、認識の差を評価するためのデータ分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1生成的AIに研究タスクを委ねる研究者について、一般の人々は人間の博士課程学生に委ねる場合と比較して、どの程度道徳的受容性が低いと判断するか?
  • RQ2LLMにタスクを委ねることで、研究者が将来のプロジェクトを監視できる能力に対する信頼性がどの程度低下するか?
  • RQ3LLMと共同して研究が行われた場合と人間研究者と共同した場合とで、正確性および品質に関する認識にどのような差が生じるか?
  • RQ4このようなバイアスが、学術的研究におけるAIの報告および採用にどのような潜在的影響を及えるか?

主な発見

  • 参加者は、LLMに研究タスクを委ねることを、人間の博士課程学生に委ねることよりも顕著に道徳的に受容できないと判断した。効果量は大きく(d = -0.78)。
  • LLMを使用した場合、研究者が将来のプロジェクトを監視できる能力に対する信頼性が著しく低下した。効果量は大きく(d = -0.80)。
  • LLMと共同して作成された研究結果の正確性および品質については、参加者が低いと認識した。効果量は大きく(d = -0.85)。
  • 結果から、AI支援研究に対する強い社会的バイアスが生じており、これは学術的業務におけるAI使用の報告不足を引き起こす可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。