Skip to main content
QUICK REVIEW

[논문 리뷰] A Large Language Model Approach to Educational Survey Feedback Analysis

Michael Parker, Caitlin Anderson|arXiv (Cornell University)|2023. 09. 29.
Topic Modeling참고 문헌 83인용 수 6
한 줄 요약

이 논문은 피드백 분석을 자동화하기 위해 GPT-4와 GPT-3.5를 사용하는 zero-shot, 프롬프트 기반 워크플로우를 제안한다. 분류, 추출, 감성 분석, 주제 분석을 자연어 처리 작업으로 간주함으로써, 미세조정 없이도 실제 생물의학 과정 설문지 데이터에서 인간 수준의 성능을 달성한다. 이는 LLM이 교육 평가 및 향상에 있어 확장 가능하고 조합 가능한 도구로 활용될 수 있음을 보여준다.

ABSTRACT

This paper assesses the potential for the large language models (LLMs) GPT-4 and GPT-3.5 to aid in deriving insight from education feedback surveys. Exploration of LLM use cases in education has focused on teaching and learning, with less exploration of capabilities in education feedback analysis. Survey analysis in education involves goals such as finding gaps in curricula or evaluating teachers, often requiring time-consuming manual processing of textual responses. LLMs have the potential to provide a flexible means of achieving these goals without specialized machine learning models or fine-tuning. We demonstrate a versatile approach to such goals by treating them as sequences of natural language processing (NLP) tasks including classification (multi-label, multi-class, and binary), extraction, thematic analysis, and sentiment analysis, each performed by LLM. We apply these workflows to a real-world dataset of 2500 end-of-course survey comments from biomedical science courses, and evaluate a zero-shot approach (i.e., requiring no examples or labeled training data) across all tasks, reflecting education settings, where labeled data is often scarce. By applying effective prompting practices, we achieve human-level performance on multiple tasks with GPT-4, enabling workflows necessary to achieve typical goals. We also show the potential of inspecting LLMs' chain-of-thought (CoT) reasoning for providing insight that may foster confidence in practice. Moreover, this study features development of a versatile set of classification categories, suitable for various course types (online, hybrid, or in-person) and amenable to customization. Our results suggest that LLMs can be used to derive a range of insights from survey text.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)인 GPT-4와 GPT-3.5를 사용하여, 미세조정이나 레이블이 부여된 데이터 없이 교육 설문 피드백의 정성적 분석을 자동화할 수 있는지 탐색한다.
  • zero-shot 프롬프팅이 다중 레이블 분류, 감성 분석, 정보 추출과 같은 다양한 NLP 작업에서 교육적 맥락에서 인간 수준의 성능을 달성할 수 있는지 평가한다.
  • LLM에서의 체인 오브 토의(Chain-of-Thought) 추론이 설문 피드백 분석의 해석 가능성과 사용자 신뢰도를 향상시키는 데 얼마나 효과적인지 평가한다.
  • 다양한 강의 형식(온라인, 대면, 하이브리드)에 적용 가능한 맞춤형이고 조합 가능한 LLM 기반 NLP 워크플로우 프레임워크를 개발한다.
  • LLM이 교육 피드백 분석에서 수동 애너테이션 또는 전용 기계학습 모델에 대한 의존도를 줄일 수 있는가를 입증한다.

제안 방법

  • 연구는 교육 설문 분석을 다중 레이블 분류, 이진 분류, 감성 분석, 명명된 실체 추출 등의 연속적인 NLP 작업으로 간주하여 zero-shot 프롬프팅을 적용한다.
  • 생물의학 과정의 컨텐츠, 강의 방식, 인structor, 물리적 로지스틱 요소 등을 포함하는 22개의 분류 카테고리로 구성된 고유한 분류 체계를 개발하였다.
  • GPT-4와 GPT-3.5로부터 구조적이고 신뢰할 수 있는 응답을 이끌어내기 위해 소수 샘플 및 체인 오브 토의 기법을 활용해 프롬프트를 정교하게 설계하였다.
  • 실제로 수집된 온라인 생물의학 과정의 2,500개 설문 댓글에 대한 인간 애너테이션 기반 황금 표준(Gold Standard)을 사용하여 성능을 평가하였다.
  • 정답 분류 결과와의 일관성과 일치 여부를 분석하여 체인 오브 토의 추론의 일관성을 평가하였다.
  • 다양한 작업에 걸쳐 워크플로우를 테스트하였으며, 결과를 인간 애너테이터 및 RoBERTa, SetFit 등의 베이스라인 모델과 비교하였다.
Figure 1: Derivation of themes from student comments (results shown using GPT-4).
Figure 1: Derivation of themes from student comments (results shown using GPT-4).

실험 결과

연구 질문

  • RQ1GPT-4를 사용한 zero-shot 프롬프팅이 교육 설문 피드백의 다중 레이블 분류, 감성 분석, 정보 추출 작업에서 인간 수준의 성능을 달성할 수 있는가?
  • RQ2체인 오브 토의 추론은 LLM이 생성한 설문 분석 결과의 해석 가능성과 신뢰도를 향상시키는 데 얼마나 효과적인가?
  • RQ3일관된, 재사용 가능한 LLM 기반 워크플로우가 온라인, 하이브리드, 대면 강의와 같은 다양한 강의 유형에 최소한의 재구성으로 적용될 수 있는가?
  • RQ4GPT-4의 성능은 GPT-3.5 및 전용 모델(RoBERTa, SetFit 등)과 비교해 복잡한 미세조정 없이 교육 피드백 분석에서 어떻게 다를까?
  • RQ5LLM은 교육 피드백 분석에서 수동 애너테이션 또는 미세조정된 모델에 대한 의존도를 어느 정도 줄일 수 있는가?

주요 결과

  • GPT-4는 오직 zero-shot 프롬프팅만으로도 다중 레이블 분류(F1-score 0.85), 감성 분석(F1-score 0.87), 정보 추출 작업에서 인간 수준의 성능을 달성하였다.
  • GPT-4의 체인 오브 토의 추론은 일관되고 논리적인 근거를 제시하여 모델 출력의 해석 가능성과 사용자 신뢰도를 향상시켰다.
  • GPT-3.5는 감성 분석 및 이진 분류 작업에서 낮은 성능이지만 여전히 의미 있는 성능을 보였으며, GPT-4의 정확도에는 미치지 못했다.
  • LLM 기반 워크플로우는 여러 작업 간에 성공적으로 조합되어, 모델의 미세조정이나 도메인 특화 데이터 없이도 설문 피드백의 종단 간 분석을 가능하게 하였다.
  • 이 연구에서 개발한 22개의 맞춤형 카테고리 분류 체계는 다양한 강의 형식에서 효과적이었으며, 다른 교육 맥락에 적용하기 위해 프롬프트 수정을 최소한으로 조정할 수 있었다.
  • 결과적으로 LLM, 특히 GPT-4는 교육 분야에서 수동 또는 전용 모델 기반 설문 분석의 확장 가능하고 유연하며 해석 가능한 대안이 될 수 있음을 시사한다.
Figure 2: Multi-label classification of student comments (results shown using GPT-4).
Figure 2: Multi-label classification of student comments (results shown using GPT-4).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.