Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing textual textbook question answering with large language models and retrieval augmented generation

Hessa Abdulrahman Alawwad, Areej Alhothali|arXiv (Cornell University)|2024. 02. 05.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 Llama-2를 미세조정하여 교과서 질문 응답(TQA)을 향상시키기 위한 검색 증강 생성(RAG) 프레임워크를 제안하며, 특히 여러 수업에 걸쳐 흩어진 핵심 개념으로 인해 발생하는 '도메인 외 문제'를 해결한다. 벡터 데이터베이스에서 관련 주제를 검색하고 전체 수업 맥락과 통합함으로써, 기준 Llama-2보다 미세조정되지 않은 상태에서 테스트 세트에서 비도안 다중선택 질문에 대해 9.84%의 정확도 향상을 달성한다.

ABSTRACT

Textbook question answering (TQA) is a challenging task in artificial intelligence due to the complex nature of context needed to answer complex questions. Although previous research has improved the task, there are still some limitations in textual TQA, including weak reasoning and inability to capture contextual information in the lengthy context. We propose a framework (PLRTQA) that incorporates the retrieval augmented generation (RAG) technique to handle the out-of-domain scenario where concepts are spread across different lessons, and utilize transfer learning to handle the long context and enhance reasoning abilities. Our architecture outperforms the baseline, achieving an accuracy improvement of 4. 12% in the validation set and 9. 84% in the test set for textual multiple-choice questions. While this paper focuses on solving challenges in the textual TQA, It provides a foundation for future work in multimodal TQA where the visual components are integrated to address more complex educational scenarios. Code: https://github.com/hessaAlawwad/PLR-TQA

연구 동기 및 목표

  • 교과서 질문 응답에서 관련 정보가 여러 수업에 흩어져 있는 '도메인 외 문제'를 해결하기 위해.
  • 대규모 언어 모델(LLM)을 활용하여 긴 복잡한 교과서 문단의 추론 및 맥락 이해 능력을 향상시키기 위해.
  • 검색 증강 생성(RAG)과 감독 미세조정을 통해 CK12-QA 데이터셋의 다중선택 질문 응답 정확도를 향상시키기 위해.
  • 장문 맥락 TQA 환경에서 RAG의 검색 후 재정렬 여부에 따른 모델 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • CK12-QA 데이터셋을 기반으로 감독 미세조정(SFT)을 통해 Llama-2를 미세조정하여 교과서 질문 응답 작업에 적합하게 조정한다.
  • 수업 주제의 임베딩을 저장하기 위해 벡터 데이터베이스를 사용하는 검색 증강 생성(RAG) 파이프라인을 구현한다.
  • 각 질문에 대해 전체 데이터셋에서 관련 주제를 검색하기 위해 밀도 벡터 유사도(내적 곱)를 사용하며, 질문의 소스 수업을 초월한 맥락 확장을 가능하게 한다.
  • 전체 수업과 검색된 주제를 모두 LLM 프롬프트의 맥락으로 통합하여 답변 생성을 향상시킨다.
  • 검색된 주제의 정렬을 개선하고 노이즈를 줄이기 위해 재정렬 메커니즘을 적용한다.
  • 비도안 다중선택 질문에 대한 검증 및 테스트 세트의 정확도를 사용하여 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1개념이 여러 수업에 흩어져 있을 경우, 검색 증강 생성(RAG)이 LLM의 교과서 질문 응답 성능을 향상시킬 수 있는가?
  • RQ2다른 수업의 검색된 주제를 통합할 경우, 장문 맥락 TQA 작업에서 LLM의 추론 능력과 정확도에 어떤 영향을 미치는가?
  • RQ3RAG에 재정렬 모듈을 사용할 경우, 부적절한 맥락이 추가될 가능성이 있어 모델 성능이 향상되거나 저하되는가?
  • RQ4Llama-2를 도메인 특화 교과서 QA에 대해 감독 미세조정할 경우, 기본 모델 대비 성능 향상 정도는 어느 정도인가?

주요 결과

  • 기준 Llama-2 모델은 모든 텍스트 질문에 대해 검증 세트에서 38.09%의 정확도, 테스트 세트에서 38.54%의 정확도를 기록하여 TQA에서의 제로샷 성능이 열악함을 보여준다.
  • 재정렬 없이 RAG를 통합한 결과, 검증 세트에서 83.58%, 테스트 세트에서 83.80%의 정확도를 달성하여 성능 향상이 뚜렷하게 나타났다.
  • 전체 수업과 RAG를 통해 검색된 주제를 모두 통합한 결과, 검증 세트에서 83.78%, 테스트 세트에서 81.73%의 정확도를 기록하였으며, 이는 맥락 창 크기 포화로 인해 테스트 세트에서 약간의 하락이 있었다.
  • 재정렬된 주제를 통합한 결과, 검증 세트에서 80.74%, 테스트 세트에서 79.22%의 정확도를 기록하여 노이즈가 있거나 부적절한 검색된 주제가 모델 추론 성능을 저하시킬 수 있음을 시사한다.
  • 제안된 RAG 기반의 미세조정된 Llama-2 모델은 기준 Llama-2 대비 검증 세트에서 4.12%의 정확도 향상을, 테스트 세트의 비도안 다중선택 질문에서는 9.84%의 정확도 향상을 달성하였다.
  • 분석 결과, 질문의 44%만이 정확한 수업 주제를 검색했으며, 재정렬을 적용한 후에도 정확한 수업에서의 검색 비율이 52.43%에 불과하여 도메인 외 상황에서 RAG의 필요성을 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.