Skip to main content
QUICK REVIEW

[논문 리뷰] Brave new world: Artificial Intelligence in teaching and learning

Adrian Groza, Anca Marginean|arXiv (Cornell University)|2023. 09. 27.
Online Learning and AnalyticsComputer Science인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)인 ChatGPT와 BARD가 고등교육에 통합되는 것을 분석하며, 표절, 오락성 정보, 편향 등의 위험을 완화하기 위해 기관 차원의 AI 정책이 필요하다고 주장한다. 연구는 LLMs가 고급 모델에 접근할 수 있는 더 부유한 학생들에게 유리하게 작용함으로써 기존의 불평등을 악화시킨다는 점을 보여주며, 현재의 AI 도구가 종종 환상적 또는 사실과 어긋난 내용을 생성한다는 점에서, 교육 및 평가 과정에서 비판적 리터러시와 기관의 감독이 필수적임을 밝힌다.

ABSTRACT

We exemplify how Large Language Models are used in both teaching and learning. We also discuss the AI incidents that have already occurred in the education domain, and we argue for the urgent need to introduce AI policies in universities and for the ongoing strategies to regulate AI. Regarding policy for AI, our view is that each institution should have a policy for AI in teaching and learning. This is important from at least twofolds: (i) to raise awareness on the numerous educational tools that can both positively and negatively affect education; (ii) to minimise the risk of AI incidents in education.

연구 동기 및 목표

  • 대학 교육에서 대규모 언어 모델(LLMs)의 현재 및 잠재적 영향을 분석하는 것.
  • 표절, 오락성 정보, 환상적 내용 등 실제 교육 현장에서의 AI 오용 사례를 드러내는 것.
  • 학술 환경에서의 위험을 줄이고 AI 사용을 규제하기 위해 기관 차원의 AI 정책이 필수적이라는 점을 주장하는 것.
  • LLMs가 고소득 및 저소득 학생 간 교육 형평성 문제를 어떻게 악화시킬 수 있는지 분석하는 것.
  • LLMs의 한계에 대한 비판적 인식을 고취시키고, 교사가 AI 생성 콘텐츠와 인간이 생성한 콘텐츠를 구분하도록 학생들을 지도할 필요성을 제시하는 것.

제안 방법

  • 공개 데이터베이스 및 사례 연구에서 확보된 교육 분야의 AI 사고를 분석하여, 가짜 법적 인용문과 BARD에서 유래한 오락성 정보를 포함한다.
  • 실제 프롬프트를 사용하여 LLMs의 과제 수행 능력(예: 퀴즈 생성, 에세이 작성, 프sentation 제작)을 평가한다.
  • 유럽연합의 인공지능법 및 제안된 글로벌 인공지능 기구와 같은 기존의 AI 규제 프레임워크를 검토하여 교육 분야에 대한 적용 가능성을 평가한다.
  • LLMs의 '평균 입력, 평균 출력' 현상을 분석하며, 훈련 데이터의 질이 모델 출력의 질을 반영함으로써 출력이 평균 수준에 머무르는 경향이 있음을 밝힌다.
  • E-rater 및 Turnitin의 AI 탐지 기능과 같은 AI 기반 평가 도구의 한계를 평가하며, 잘못된 양성 결과와 인종·성별 편향을 포함한다.
  • 하나의 하향식 AI 생태계 교육 정책 프레임워크를 제안하고, 책임감 있고 투명한 AI 사용을 보장하기 위해 상향식 규제 전략을 주장한다.

실험 결과

연구 질문

  • RQ1현재 대규모 언어 모델(LLMs)는 교육 현장에서 어떻게 사용되고 있으며, 주요 이점과 위험 요소는 무엇인가?
  • RQ2교육 분야에서 가장 심각한 AI 사고는 무엇이며, 이는 LLMs의 한계와 위험성을 어떻게 드러내는가?
  • RQ3LLMs는 고소득 학생과 저소득 학생 간의 모델 접근성 격차를 어떻게 악화시키거나 증폭시키는가?
  • RQ4E-rater 및 Turnitin의 AI 탐지기와 같은 AI 기반 평가 도구가 얼마나 편향되거나 정확하지 못한 결과를 낼 수 있는가?
  • RQ5고등교육에서 AI의 책임감 있고 형평성 있는 사용을 보장하기 위해 필요한 기관 차원의 정책과 교육 전략은 무엇인가?

주요 결과

  • ChatGPT와 BARD와 같은 LLMs는 이미 학생들이 에세이, 퀴즈, 프sentation를 생성하는 데 사용되고 있으며, 이는 종종 일반적이고 창의성이 떨어지는 'GPT 스타일'의 콘텐츠를 낳는다.
  • LLMs를 사용하는 학생의 50퍼센트는 평균 또는 만족스러운 성적을 받을 수 있으며, 이는 LLMs가 고득점자보다는 저능력 학습자에게 더 유익할 수 있음을 시사한다.
  • 가짜 법적 인용문과 오락성 정보 사례(예: BARD가 홀로코스트 부정론을 생성)는 LLMs가 신뢰할 수 있는 것처럼 보이지만 사실이 아닌 내용을 생성할 수 있음을 보여준다.
  • E-rater와 같은 AI 기반 에세이 채점 도구는 난문 텍스트에도 높은 점수를 매기는 것으로 밝혀져, 자동 평가의 체계적 결함을 드러낸다.
  • AI 평가 도구의 편향이 입증되었으며, 중국계 유학생에게는 높은 점수, 아프리카계 미국인 유학생에게는 낮은 점수가 매겨지는 등 이전 데이터의 편향이 반영된 바 있다.
  • 투명성 기능이 있더라도 사용자는 종종 자신의 대화 기록이 모델 재학습에 사용될 수 있음을 인지하지 못하며, 특히 비공개 데이터를 공유할 경우 개인정보 보호 문제를 야기한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.