Skip to main content
QUICK REVIEW

[논문 리뷰] AI-TA: Towards an Intelligent Question-Answer Teaching Assistant using Open-Source LLMs

Yann Hicke, Anmol Agarwal|arXiv (Cornell University)|2023. 11. 05.
Expert finding and Q&A systems인용 수 7
한 줄 요약

이 논문은 온라인 교육 플랫폼을 위한 오픈소스이자 프라이버시를 고려한 질문-답변 기반 수업 보조 시스템인 AI-TA를 소개한다. 이는 LLaMA-2 기반으로 Retrieval-Augmented Generation (RAG), Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO)를 활용하여 답변 품질을 향상시킨다. CS1 과정의 Piazza 데이터셋에서 답변 품질이 30% 향상되었으며, 인간 평가와의 높은 일치도를 보이며 BertScore와 같은 자동 평가 지표보다도 뛰어난 성능을 보였다.

ABSTRACT

Responding to the thousands of student questions on online QA platforms each semester has a considerable human cost, particularly in computing courses with rapidly growing enrollments. To address the challenges of scalable and intelligent question-answering (QA), we introduce an innovative solution that leverages open-source Large Language Models (LLMs) from the LLaMA-2 family to ensure data privacy. Our approach combines augmentation techniques such as retrieval augmented generation (RAG), supervised fine-tuning (SFT), and learning from human preferences data using Direct Preference Optimization (DPO). Through extensive experimentation on a Piazza dataset from an introductory CS course, comprising 10,000 QA pairs and 1,500 pairs of preference data, we demonstrate a significant 30% improvement in the quality of answers, with RAG being a particularly impactful addition. Our contributions include the development of a novel architecture for educational QA, extensive evaluations of LLM performance utilizing both human assessments and LLM-based metrics, and insights into the challenges and future directions of educational data processing. This work paves the way for the development of AI-TA, an intelligent QA assistant customizable for courses with an online QA platform

연구 동기 및 목표

  • 대규모 컴퓨팅 과정에서 수천 건의 학생 질문에 응답하는 데 드는 높은 인적 비용 문제를 해결하기 위해.
  • 제3자 기업의 전용 모델 대신 오픈소스 LLM을 사용하여 확장 가능하고 프라이버시를 보장하는 교육용 QA 시스템을 개발하기 위해.
  • 검색 기반 생성, 감독적 미세조정, 선호도 기반 최적화의 조합을 통해 답변 품질을 향상시키기 위해.
  • 인간 평가 기준과 LLM 기반 평가를 모두 활용하여 모델 성능을 평가함으로써 인간 판단과의 일치도를 확보하기 위해.
  • 다양한 과목의 온라인 QA 플랫폼에 적용 가능한 커스터마이징 가능하고 확장 가능한 파이프라인을 제공하기 위해.

제안 방법

  • 파이프라인은 과정 자료를 활용해 답변를 관련 내용에 기반하게 하는 검색 기반 생성(RAG)을 통합한다.
  • LLM이 과정 특화된 언어와 내용에 맞게 정렬되도록 10,000개의 Piazza QA 쌍을 대상으로 감독적 미세조정(SFT)을 적용한다.
  • 강화학습 기반 훈련의 복잡한 설정을 피하기 위해, 1,500개의 선호도 쌍을 기반으로 직접 선호도 최적화(DPO)를 사용하여 답변 품질을 향상시킨다.
  • 기본 모델은 성능이 우수하고 오픈소스이기 때문에 데이터 프라이버시를 확보할 수 있는 LLaMA-2로 선택되었다.
  • 평가에는 GPT-4를 심판 모델로 사용하고, 유용성, 정확도, 종합 품질에 대한 인간 평가 기준을 함께 사용한다.
  • LLM 기반 평가, 인간 평가, 자동 평가(BertScore) 지표 간의 상관관계 분석을 수행하여 일치도를 검증한다.
Figure 1: Overview of AI-TA ’s pipeline: we combine multiple techniques including (1) Retrieval-Augmented-Generation (RAG) using course materials, (2) Supervised Fine-tuning (SFT) using Piazza QA data, and (3) Learning from human preferences, for which we use Direct Policy Optimization (DPO) as a pr
Figure 1: Overview of AI-TA ’s pipeline: we combine multiple techniques including (1) Retrieval-Augmented-Generation (RAG) using course materials, (2) Supervised Fine-tuning (SFT) using Piazza QA data, and (3) Learning from human preferences, for which we use Direct Policy Optimization (DPO) as a pr

실험 결과

연구 질문

  • RQ1LLaMA-2와 같은 오픈소스 LLM이 RAG, SFT, DPO를 통해 효과적으로 미세조정되고 향상될 수 있는가?
  • RQ2실제 교육 QA 데이터에서 RAG, SFT, DPO의 조합이 기준 모델 대비 답변 품질 측면에서 어떻게 비교되는가?
  • RQ3교육 QA 맥락에서 LLM 기반 평가가 인간 평가 기준과 얼마나 높은 상관관계를 가지는가?
  • RQ4BertScore가 인간 평가 및 LLM 기반 평가에 비해 교육적 답변 품질 측정에 얼마나 유사한가?
  • RQ5LLM을 활용한 교육 QA 데이터 처리 및 평가 과정에서의 주요 과제와 한계는 무엇인가?

주요 결과

  • 제안된 파이프라인은 기준 LLaMA-2 모델 대비 답변 품질에서 30% 향상되었으며, RAG가 가장 큰 영향을 미친 요소였다.
  • 인간 평가 결과, GPT-4를 활용한 LLM 기반 평가와 인간 평가 기준의 종합 품질 간 상관계수(r = 0.662)는 중간에서 강한 수준의 상관관계를 보였다.
  • LLM 기반 평가가 BertScore보다 인간 평가와 더 높은 일치도를 보였으며, BertScore는 인간 평가와 약한 상관관계(r = 0.383)를 보였다.
  • 혼동 행렬 분석 결과, LLM 평가자가 인간 평가자보다 더 관대한 경향이 있었으며, 많은 경우 더 높은 점수를 부여하는 경향을 보였다.
  • DPO 기반 선호도 최적화는 RLHF의 복잡한 강화학습 설정 없이도 효과적인 경량 대체 수단으로 기능했으며, 답변 품질 향상에 기여했다.
  • RAG를 통한 과정 자료 통합은 생성된 답변의 사실적 정확도와 관련성 향상에 크게 기여했다.
AI-TA: Towards an Intelligent Question-Answer Teaching Assistant using Open-Source LLMs

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.