[논문 리뷰] Automated Reading Passage Generation with OpenAI's Large Language Model
이 논문은 OpenAI의 GPT-3 언어 모델을 사용하여 자동으로 독해 지문을 생성하는 방법을 제안한다. 정교하게 설계된 프롬프트를 활용해 원본 지문과 내용, 구조, Lexile 점수에서 유사한 초등 4학년 수준의 지문을 생성한다. 이 방법은 인공지능 생성과 인간의 검토 및 평가를 결합하여 생성된 텍스트의 일관성, 난이도, 연령 적합성 면에서 높은 수준을 달성한다.
The widespread usage of computer-based assessments and individualized learning platforms has resulted in an increased demand for the rapid production of high-quality items. Automated item generation (AIG), the process of using item models to generate new items with the help of computer technology, was proposed to reduce reliance on human subject experts at each step of the process. AIG has been used in test development for some time. Still, the use of machine learning algorithms has introduced the potential to improve the efficiency and effectiveness of the process greatly. The approach presented in this paper utilizes OpenAI's latest transformer-based language model, GPT-3, to generate reading passages. Existing reading passages were used in carefully engineered prompts to ensure the AI-generated text has similar content and structure to a fourth-grade reading passage. For each prompt, we generated multiple passages, the final passage was selected according to the Lexile score agreement with the original passage. In the final round, the selected passage went through a simple revision by a human editor to ensure the text was free of any grammatical and factual errors. All AI-generated passages, along with original passages were evaluated by human judges according to their coherence, appropriateness to fourth graders, and readability.
연구 동기 및 목표
- 컴퓨터 기반 평가 및 개인화된 학습 플랫폼에서 빠르고 고품질의 독해 지문에 대한 수요 증가에 대응하기 위해.
- 대규모 언어 모델을 활용해 인간 전문가에 대한 의존도를 줄이고 지문 개발 과정을 자동화하기 위해.
- 생성된 지문이 실제 초등 4학년 독해 자료의 언어적 복잡성과 구조를 정확히 반영하도록 보장하기 위해.
- 인간 평가를 통해 생성된 지문의 일관성, 난이도, 연령 적합성 평가하기 위해.
- 실용적인 교육적 응용을 위해 LLM 생성과 최소한의 인간 감시를 조합한 확장 가능한 파이프라인 구축하기 위해.
제안 방법
- 정교하게 설계된 프롬프트를 기반으로, 트랜스포머 기반 언어 모델인 OpenAI의 GPT-3를 사용해 독해 지문을 생성한다.
- 기존의 초등 4학년 독해 지문을 기반으로 프롬프트를 설계하여 모델이 원본의 내용과 구조 패턴을 따르도록 유도한다.
- 각 프롬프트당 다수의 지문을 생성하고, 원본 지문과 Lexile 점수 일치도를 기준으로 최종 버전을 선정한다.
- 선택된 지문의 문법적 오류와 사실 오류를 수정하기 위해 인간 편집 검토를 적용한다.
- 모든 생성된 지문과 원본 지문을 인간 평가자들이 일관성, 난이도, 연령 적합성 측면에서 평가한다.
- 일반적인 초등 4학년 교육 과정 기대 수준과 일치하도록 교육 기준을 유지한다.
실험 결과
연구 질문
- RQ1GPT-3는 실제 초등 4학년 수준의 지문과 유사한 일관성과 구조를 갖춘 지문을 생성할 수 있는가?
- RQ2AI로 생성된 지문이 원본 지문의 Lexile 수준과 어느 정도 일치하는가?
- RQ3인간 평가자들은 AI로 생성된 지문의 난이도와 연령 적합성에 대해 인간이 작성한 원본과 비교해 어떻게 평가하는가?
- RQ4인간의 수정이 AI로 생성된 독해 지문의 품질 향상에 어떤 역할을 하는가?
- RQ5GPT-3를 활용한 프롬프트 기반 피팅 조정 방법으로 대규모로 일관성 있는 고품질 교육용 지문을 생성할 수 있는가?
주요 결과
- AI로 생성된 지문은 원본 지문과 높은 Lexile 점수 일치도를 보이며, 유사한 텍스트 복잡성 수준을 확보했다.
- 인간 평가자들은 생성된 지문이 초등 4학년 학생들에게 매우 잘 맞는 것으로 평가했다.
- 난이도 평가 결과, 생성된 지문이 목표 연령 수준의 언어적 기대 수준을 충족함을 확인했다.
- 인간의 수정이 최종 출력물의 문법 정확성과 사실적 정확성 향상에 뚜렷한 기여를 했다.
- 프롬프트 엔지니어링과 최소한의 인간 감시를 조합한 방식이, 핵심 평가 차원에서 인간이 작성한 지문과 구분되지 않을 정도로 높은 품질의 지문을 생성했다.
- 이 방법은 대규모 자동 생성에 있어 확장 가능하고 실용적인 가능성을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.