Skip to main content
QUICK REVIEW

[論文レビュー] Brave new world: Artificial Intelligence in teaching and learning

Adrian Groza, Anca Marginean|arXiv (Cornell University)|Sep 27, 2023
Online Learning and AnalyticsComputer Science被引用数 3
ひとこと要約

本稿は、チャットGPT や BARD などの大規模言語モデル(LLM)が高等教育における統合について検討し、捏造、誤情報、バイアスなどのリスクを軽減するための機関レベルのAI政策の必要性を主張している。LLMは、高価なモデルにアクセスできるより裕福な学生に有利に働くことによって、既存の不平等を拡大しており、現在のAIツールはしばしば幻覚的または事実誤認の内容を生成するため、教育現場における批判的リテラシーと機関の監視が不可欠であることを示している。

ABSTRACT

We exemplify how Large Language Models are used in both teaching and learning. We also discuss the AI incidents that have already occurred in the education domain, and we argue for the urgent need to introduce AI policies in universities and for the ongoing strategies to regulate AI. Regarding policy for AI, our view is that each institution should have a policy for AI in teaching and learning. This is important from at least twofolds: (i) to raise awareness on the numerous educational tools that can both positively and negatively affect education; (ii) to minimise the risk of AI incidents in education.

研究の動機と目的

  • 高等教育における大規模言語モデル(LLM)の現在および将来の影響を分析すること。
  • 捏造、誤情報、幻覚的コンテンツを含む、教育分野におけるAIの誤用事例を浮き彫りにすること。
  • 学術的環境におけるAI利用のリスクを低減するための機関レベルのAI政策の必要性を主張すること。
  • LLMが、特に高所得者と低所得者との間で教育的格差を悪化させる仕組みを検討すること。
  • LLMの限界に対する意識的認識を高め、教育者がAI生成コンテンツと人間生成コンテンツを区別するのを学生が学べるよう支援する必要性を促すこと。

提案手法

  • 公的データベースや事例研究から教育分野におけるAIの不正利用事例(例:架空の法的引用、BARDによる誤情報)を分析する。
  • 実際のプロンプトを用いて、クイズ作成、エッセイ作成、プレゼンテーション作成などの教育的タスクにおけるLLMのパフォーマンスを評価する。
  • EU人工知能法や国際的AI機関の設立をめぐる草案といった既存のAI規制枠組みをレビューし、教育分野への適用可能性を検討する。
  • LLMにおける「平均入力、平均出力」現象を検討し、訓練データの質がモデル出力に反映され、結果として中程度の内容に終わることを示す。
  • E-rater や Turnitin のAI検出機能といったAIベースの評価ツールの限界を評価する。特に、誤検出や人種的・性別のバイアスが問題視されている。
  • 下位から上位へのAI生態教育政策フレームワークを提言し、責任と透明性を確保するための上位からの規制戦略を提唱する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデル(LLM)は現在、教育現場でどのように使用されており、主な利点とリスクは何か?
  • RQ2教育分野における最も深刻なAI事故事例は何か。それらはLLMの限界と危険性をどのように明らかにしているか?
  • RQ3LLMは教育的格差をどのように助長するか。特にGPT-4のような高機能モデルへのアクセス格差に関して。
  • RQ4E-rater や Turnitin のAI検出機能といったAIベースの評価ツールは、どれほどバイアスや誤った結果を出力するか?
  • RQ5高等教育におけるAIの責任あるかつ公平な利用を確保するための機関レベルの政策と教育戦略は何か?

主な発見

  • ChatGPT や BARD といったLLMは、すでに学生がエッセイ、クイズ、プレゼンテーションを生成するために使用されており、しばしば「GPT風」のありきたりで創造性に欠けた内容を生み出している。
  • LLMを利用している学生の50%は平均的または満足できる成績を達成する可能性がある。これは、LLMが高水準の学習者よりも、低スキルな学習者にとってより有益であることを示している。
  • 架空の法的引用や誤情報(例:BARDがホロコースト否定の主張を生成)といった事例は、LLMが信ぴょう性の高いが事実誤認の内容を生成できることを示している。
  • E-rater といったAIベースのエッセイ採点ツールは、意味のないテキストに対しても高得点を与えることが確認されており、自動評価のシステム的欠陥を示している。
  • AI評価ツールにおけるバイアスは、中国系の学生に対して高いスコア、アフリカ系アメリカ人の学生に対して低いスコアを出す傾向として記録されており、歴史的データバイアスの反映である。
  • 透明性の特徴があるにもかかわらず、ユーザーはしばしば、自身のチャット履歴がモデルの再訓練に使われる可能性があることに気づかない。特に個人情報が共有された場合、プライバシー懸念が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。