[論文レビュー] Could an Artificial-Intelligence agent pass an introductory physics course?
本研究では、ミシガン州立大学の実際の授業資料を用いて、大規模言語モデルであるChatGPTが、代表的な課題(宿題、試験、プログラミング課題)を解くことで、標準的な積分微分を用いた物理学入門課程に合格できるかを評価する。ChatGPTは説得力のある説明を生成するが、1.5(4.0スケール)というわずかな得点で合格にとどまり、根深い誤解、計算ミス、メタ認知の欠如が明らかとなり、物理学教育において記憶に頼る問題解決ではなく、批判的思考を重視する必要があることを示している。
Massive pre-trained language models have garnered attention and controversy due to their ability to generate human-like responses: attention due to their frequent indistinguishability from human-generated phraseology and narratives, and controversy due to the fact that their convincingly presented arguments and facts are frequently simply false. Just how human-like are these responses when it comes to dialogues about physics, in particular about the standard content of introductory physics courses? This study explores that question by having ChatGTP, the pre-eminent language model in 2023, work through representative assessment content of an actual calculus-based physics course and grading the responses in the same way human responses would be graded. As it turns out, ChatGPT would narrowly pass this course while exhibiting many of the preconceptions and errors of a beginning learner.
研究の動機と目的
- ChatGPTのような最先端の言語モデルが、標準的な積分微分を用いた物理学入門課程を成功裏に修了・合格できるかどうかを評価すること。
- 人間の学生と比較して、ChatGPTの回答の質と正確性、特に概念的理解、問題解決戦略、計算の正確性の観点から評価すること。
- AIが生成する回答が、初心者の物理学学習者に見られるのと同じ誤解や誤りを示すかどうかを調査すること、特に推論と数値計算の面で。
- AIの成績が物理学教育に与える影響、特に評価設計、学術的誠実性、熟練者に近い認識論的スキルの発達の観点から検討すること。
- ChatGPTのようなAIツールが、物理学教育の目的を損なうのか、あるいは再定義するのかを特定すること、特に批判的評価とメタ認知の育成の観点から。
提案手法
- ChatGPTは、ミシガン州立大学の1年次積分微分を用いた物理学コースから実際の課題(宿題、クリックラー質問、試験、プログラミング演習)を提示した。
- 回答は、人間の学生の答案に適用されるのと同じ採点基準(概念的推論、数学的実行、単位の使用)を用いて評価された。
- 本研究では、2023年1月9日リリースのChatGPTを使用し、課題間での一貫性と再現性を確保した。
- 課題の一部は、問題パラメータをランダム化するLON-CAPAというプラットフォームから抽出され、単純なパターンマッチングを防いだ。
- ChatGPTの回答は、次元解析、極限ケース、一貫性の確認といった、専門家が用いる問題解決戦略と整合しているか分析された。
- AIの回答は、典型的な初心者学生の誤り(経路依存性の誤解、単位の省略、累積的な丸め誤差)と比較された。

実験結果
リサーチクエスチョン
- RQ1大規模言語モデルであるChatGPTが、実際の授業資料を用いて標準的な積分微分を用いた物理学入門課程を解き、合格できるか?
- RQ2ChatGPTの回答は、物理学初心者に一般的に見られる誤解や誤りをどの程度反映しているか?
- RQ3概念的推論、計算の正確性、問題解決戦略の使用に関して、ChatGPTの成績は人間の学生と比べてどの程度か?
- RQ4AIモデルが物理学課程に合格した場合、教育的評価、学術的誠実性、カリキュラム設計にどのような影響を与えるか?
- RQ5ChatGPTはどのような点でメタ認知を欠いており、その結果、回答の信頼性と批判的評価にどのような影響を与えるか?
主な発見
- ChatGPTは4.0スケールで1.5の最終成績を獲得し、物理学入門課程シリーズにわずかに合格した。
- モデルは、変位問題における方向転換を考慮しない、複数ステップの計算で丸め誤差を正しく伝播しないといった、初心者に一般的な誤りを示した。
- ChatGPTは頻繁に単位を省略し、戻り時間の問題で特定の変数(例:速度)が打ち消し合うことに気づかず、単に数値を代入する「穴埋め」に依存した。
- 説得力のある説明を生成できる一方で、正解と同じ確信度で誤ったまたは誤解を招く情報を提示したため、メタ認知の欠如が明らかになった。
- プログラミング言語の訓練のおかげで、計算演習では比較的高い成績を上げたが、これはAIがすでに人間の学生を上回っている可能性を示唆している。
- 本研究は、ChatGPTが標準的な評価を通過できるものの、深層的な概念的理解ではなくパターンに従った推論によって達成されており、物理学教育において批判的思考を優先する必要があることを結論づけた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。