[論文レビュー] Automated Reading Passage Generation with OpenAI's Large Language Model
本稿では、OpenAIのGPT-3言語モデルを用いて、内容、構造、Lexileスコアが元の文章と一致する小学校4年生レベルの読解文を自動生成する手法を提案する。このアプローチは、AI生成と人間によるレビュー・評価を組み合わせており、生成された文章の整合性、読みやすさ、学年適性の面で高い水準を達成している。
The widespread usage of computer-based assessments and individualized learning platforms has resulted in an increased demand for the rapid production of high-quality items. Automated item generation (AIG), the process of using item models to generate new items with the help of computer technology, was proposed to reduce reliance on human subject experts at each step of the process. AIG has been used in test development for some time. Still, the use of machine learning algorithms has introduced the potential to improve the efficiency and effectiveness of the process greatly. The approach presented in this paper utilizes OpenAI's latest transformer-based language model, GPT-3, to generate reading passages. Existing reading passages were used in carefully engineered prompts to ensure the AI-generated text has similar content and structure to a fourth-grade reading passage. For each prompt, we generated multiple passages, the final passage was selected according to the Lexile score agreement with the original passage. In the final round, the selected passage went through a simple revision by a human editor to ensure the text was free of any grammatical and factual errors. All AI-generated passages, along with original passages were evaluated by human judges according to their coherence, appropriateness to fourth graders, and readability.
研究の動機と目的
- コンピュータベースの評価やパーソナライズドレーニングプラットフォームにおける、迅速かつ高品質な読解文の需要に対応するため。
- 大規模言語モデルを用いて生成プロセスを自動化することで、読解文作成における人的専門家の依存を低減するため。
- 生成された文章が、本物の小学校4年生向け読解素材と同等の言語的複雑さと構造を持つことを保証するため。
- 人的判断を用いて生成された文章の整合性、読みやすさ、学年適性を評価するため。
- LLMによる生成と最小限の人的監視を組み合わせたスケーラブルなパイプラインを構築し、実用的な教育的応用を実現するため。
提案手法
- GPT-3(トランスフォーマーに基づく言語モデル)を用い、洗練されたプロンプトを設計して読解文を生成した。
- 既存の小学校4年生向け読解文を基にプロンプトを設計し、モデルが内容と構造のパターンを再現するように誘導した。
- 1つのプロンプトから複数の文章を生成し、元の文章と類似するLexileスコアを示したものを最終版として選定した。
- 選定された文章について、人間による編集レビューを実施し、文法的・事実的な誤りを是正した。
- 生成済みおよび元の文章をすべて、人的ジャッジによる整合性、読みやすさ、学年適性の観点から評価した。
- 生成されたコンテンツが、典型的な小学校4年生の学習課程の期待に合致するように、教育的基準を維持した。
実験結果
リサーチクエスチョン
- RQ1GPT-3は、本物の小学校4年生向け読解文と同等の整合性と構造的類似性を持つ読解文を生成できるか?
- RQ2AI生成文は、元の文章とどの程度Lexileレベルが一致するか?
- RQ3人的ジャッジは、AI生成文と人間が書いたオリジナル文の読みやすさと学年適性をどのように評価するか?
- RQ4人間による修正作業は、AI生成読解文の品質向上にどのような役割を果たすか?
- RQ5GPT-3を用いたプロンプトベースのファインチューニング手法は、スケーラブルに一貫して高品質な教育的読解文を生成できるか?
主な発見
- AI生成文は、元の文章と高いLexileスコアの一致を示し、類似したテキストの複雑さを示している。
- 人的ジャッジは、生成された文章を小学校4年生の読者に適した高水準の整合性があると評価した。
- 読みやすさの評価により、生成された文章がターゲット学年レベルの言語的期待を満たしていることが確認された。
- 人間による修正作業は、最終出力における文法的正確性と事実的正確性を顕著に向上させた。
- プロンプト工学と最小限の人的監視の組み合わせにより、人間が書いたものと区別がつかない水準の品質の文章が得られた。
- 本手法は、教育的読解教材の大量自動生成にスケーラブルかつ実用的であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。