Skip to main content
QUICK REVIEW

[논문 리뷰] The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches

Bhashithe Abeysinghe, Ruhan Circi|arXiv (Cornell University)|2024. 06. 05.
Artificial Intelligence in Law인용 수 4
한 줄 요약

이 논문은 LLM 기반 챗봇의 평가를 위한 세 가지 접근법—자동 평가 지표, 인간 평가, LLM 기반 평가—를 평가하며, 응답 품질에 대한 통찰을 향상시키기 위해 요인 기반 평가 프레임워크를 도입한다. 결과적으로 요인 기반 평가가 기존 방법보다 더 세분화된 결함을 드러내며, 인간 평가가 여전히 금표 기준으로 남아 있지만, LLM 기반 평가의 신뢰성이 떨어지며, 특히 동일한 모델이 자신의 출력을 평가할 경우 더욱 심각한 문제가 있음을 확인한다.

ABSTRACT

Chatbots have been an interesting application of natural language generation since its inception. With novel transformer based Generative AI methods, building chatbots have become trivial. Chatbots which are targeted at specific domains for example medicine and psychology are implemented rapidly. This however, should not distract from the need to evaluate the chatbot responses. Especially because the natural language generation community does not entirely agree upon how to effectively evaluate such applications. With this work we discuss the issue further with the increasingly popular LLM based evaluations and how they correlate with human evaluations. Additionally, we introduce a comprehensive factored evaluation mechanism that can be utilized in conjunction with both human and LLM-based evaluations. We present the results of an experimental evaluation conducted using this scheme in one of our chatbot implementations which consumed educational reports, and subsequently compare automated, traditional human evaluation, factored human evaluation, and factored LLM evaluation. Results show that factor based evaluation produces better insights on which aspects need to be improved in LLM applications and further strengthens the argument to use human evaluation in critical spaces where main functionality is not direct retrieval.

연구 동기 및 목표

  • 자동 평가, 인간 평가, LLM 기반 평가 방법 간 평가 과정에서 발생하는 도전 과제와 일관성 없는 점을 조사하기 위해.
  • 특히 교육과 같은 도메인 특화 환경에서 LLM 응용 프로그램에 대한 평가 기준과 지표에 대한 공감대 부족 문제를 해결하기 위해.
  • 응답 품질을 정밀한 차원(예: 정확성, 명확성, 어조 등)으로 분해하는 요인 기반 평가 메커니즘을 제안하고 검증하기 위해.
  • 자동 평가 지표(BLEURT 등), 전통적 인간 평가, 요인 기반 인간 평가, LLM 기반 평가 간의 신뢰성, 일관성, 상관관계를 비교하기 위해.
  • LLM 기반 평가자의 한계, 특히 동일한 모델이 자신의 출력을 평가할 경우의 문제점을 부각하고, 검색 기반 작업이 아닌 중요한 작업에서는 인간 평가를 권장하기 위해.

제안 방법

  • 응답 품질을 정확성, 완전성, 명확성, 어조, 독해 가능성 등과 같은 별개의 차원으로 분해하는 요인 기반 평가 프레임워크를 개발하였다.
  • 교육 보고서를 처리하는 RAG 기반 교육 챗봇(EdTalk)에 프레임워크를 적용하였으며, 인간 평가자와 LLM 기반 평가자를 모두 활용하였다.
  • 인간 평가를 두 그룹(전문가: 도메인 전문가, 초보자: 비전문가)으로 수행하였으며, 블룸의 분류 체계에 따른 다양한 질문 유형에 대해 응답을 평가하였다.
  • 정량적 비교를 위해 자동 평가 지표(BLEURT)를 사용하였으며, 평가 유형 간 일관성과 평가자 간 일치도를 평가하였다.
  • GPT-3.5를 활용해 응답을 생성하고 동일한 모델이 이를 평가하는 방식으로, LLM이 자신의 출력을 평가할 때의 신뢰성을 테스트하였다.
  • Cohen의 Kappa를 사용해 평가자 간 일치도를 분석하였으며, 요인별 및 평가자 유형별로 일치 수준을 보고하였다.
Figure 1: Median of Likert scale ratings of each evaluator. Each spoke shows how an evaluator rated a response based on the question type from Blooms Taxonomy.
Figure 1: Median of Likert scale ratings of each evaluator. Each spoke shows how an evaluator rated a response based on the question type from Blooms Taxonomy.

실험 결과

연구 질문

  • RQ1자동 평가 지표, 인간 평가, LLM 기반 평가가 LLM 챗봇 응답을 평가할 때 얼마나 상관관계가 있는가?
  • RQ2요인 기반 인간 평가가 표준 인간 평가나 자동 평가보다 더 실질적인 통찰을 제공하는 정도는 어느 정도인가?
  • RQ3평가자 전문성(전문가 대 초보자)이 응답 평가 및 평가자 간 일치도에 어떤 영향을 미치는가?
  • RQ4동일한 모델이 응답을 생성하고 평가할 경우, LLM 기반 평가의 신뢰성은 어느 정도인가?
  • RQ5현재 평가 방법이 LLM 응용 프로그램에서의 세분화된 품질 문제를 포괄하는 데에 있어 핵심적인 한계는 무엇인가?

주요 결과

  • 요인 기반 평가가 표준 평가 방법보다 훨씬 더 세부적이고 실질적인 통찰을 제공함을 확인하였으며, 특히 정확성과 명확성 부족을 특정적으로 드러내는 데 뛰어남.
  • 평가자 간 일치도는 명확성에 대해서만 중간 수준이었고, 나머지 요소는 낮았으며, 이는 평가자 간 상당한 불일치가 존재함을 시사함. 특히 초보자 평가자 간 불일치가 두드러짐.
  • LLM 기반 평가에서는 높은 자기 확신를 보였지만, 인간 평가와의 상관관계는 낮았으며, 특히 동일한 모델이 자신의 출력을 평가할 경우 더욱 심각한 문제 발생.
  • BLEURT와 같은 자동 평가 지표는 인간 평가와 유사한 경향을 보였지만, 초보자 평가자 참여 시 세부 사항을 포착하지 못해 일반화 능력이 제한됨.
  • 전문가 평가자는 항상 초보자 평가자보다 엄격하게 평가함을 확인하였으며, 이는 평가자 전문성의 영향이 평가 결과에 미치는 영향을 강조함.
  • 자동 평가, 인간 평가, LLM 기반 평가 간 결과 간 상관계수가 매우 낮게 나타나, 어느 한 방법만으로는 신뢰할 만한 평가가 불가능함을 시사함.
Figure 2: Screen capture of the EdTalk chatbot answering a question
Figure 2: Screen capture of the EdTalk chatbot answering a question

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.