Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Open-Domain Question Answering in the Era of Large Language Models

Ehsan Kamalloo, Nouha Dziri|arXiv (Cornell University)|2023. 05. 11.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs) 시대의 개방형 도메인 질의응답(QA)을 평가하며, 전통적인 어휘 일치 기반 평가 방법이 문장의 문법적 및 의미적 변형으로 인해 모델 성능을 심각하게 과소 평가한다는 점을 드러낸다. 인간 평가 결과, InstructGPT(제로샷)의 정확도가 약 60% 향상되어 NQ-open에서 최신 기술 수준에 도달했으며, 자동 평가 방법은 장문의 LLM 출력에서 환각 현상을 탐지하지 못함을 보여주며 인간 판단의 불가대체성을 입증한다.

ABSTRACT

Lexical matching remains the de facto evaluation method for open-domain question answering (QA). Unfortunately, lexical matching fails completely when a plausible candidate answer does not appear in the list of gold answers, which is increasingly the case as we shift from extractive to generative models. The recent success of large language models (LLMs) for QA aggravates lexical matching failures since candidate answers become longer, thereby making matching with the gold answers even more challenging. Without accurate evaluation, the true progress in open-domain QA remains unknown. In this paper, we conduct a thorough analysis of various open-domain QA models, including LLMs, by manually evaluating their answers on a subset of NQ-open, a popular benchmark. Our assessments reveal that while the true performance of all models is significantly underestimated, the performance of the InstructGPT (zero-shot) LLM increases by nearly +60%, making it on par with existing top models, and the InstructGPT (few-shot) model actually achieves a new state-of-the-art on NQ-open. We also find that more than 50% of lexical matching failures are attributed to semantically equivalent answers. We further demonstrate that regex matching ranks QA models consistent with human judgments, although still suffering from unnecessary strictness. Finally, we demonstrate that automated evaluation models are a reasonable surrogate for lexical matching in some circumstances, but not for long-form answers generated by LLMs. The automated models struggle in detecting hallucinations in LLM answers and are thus unable to evaluate LLMs. At this time, there appears to be no substitute for human evaluation.

연구 동기 및 목표

  • 대규모 생성형 LLM의 등장에 비추어 어휘 일치 평가의 한계를 조사하는 것.
  • NQ-open의 일부에 대해 인간이 애너테이션한 판단을 통해 최신 기술 수준의 QA 모델, 특히 LLM의 진정한 성능을 평가하는 것.
  • 자동 평가 방법(예: BEM 및 LLM 기반 평가자)의 신뢰성과 인간 판단을 비교 평가하는 것.
  • 오래된 비-LLM 모델이 인간 평가에서는 현대 LLM보다도 뛰어난 성능을 보일 수 있는지 조사하는 것.
  • 어휘 일치 평가의 실패 원인, 특히 의미 동치성과 문법적 변형으로 인한 실패 패턴을 분석하는 것.

제안 방법

  • NQ-open 및 CuratedTREC 2002에서 무작위로 선정된 1872개의 질의응답 쌍에 대해 인간 수작업 평가를 수행하였으며, 3명의 애너테이터가 참여하고 Fleiss의 카파 계수를 사용해 애너테이터 간 일致도를 확보하였다.
  • 표준 어휘 일치(정확한 일치), 정규표현식 일치, 자동 평가 모델(BEM 및 InstructGPT-eval)과의 비교를 통해 일관성과 정확도를 평가하였다.
  • 어휘 일치 평가의 실패 사례를 분석하여 문법적 변형과 의미 동치성의 패tern을 식별하고, 더 강력한 대안으로 정규표현식 일치를 제안하였다.
  • InstructGPT(제로샷 및 피셔샷), ANCE+, Contriever, TREC 2002 기반 모델을 포함한 12개의 개방형 QA 모델을 NQ-open 및 CuratedTREC 2002 양쪽 모두에서 재평가하였다.
  • 20년 전의 통계 모델과 현대 LLM을 비교하기 위해 CuratedTREC 2002 데이터셋을 장기적 벤치마크로 활용하여 일반화 능력과 지식 출처 사용 방식을 테스트하였다.
  • 다양한 평가 방법 간 성능 격차를 측정하였으며, 특히 LLM 출력에서 발생하는 환각 현상이 자동 평가 지표에 어떤 영향을 미치는지 분석하고, 인간 평가가 여전히 필수적임을 입증하였다.

실험 결과

연구 질문

  • RQ1모델이 생성한 응답에서 문법적 및 의미적 변형으로 인해 어휘 일치 평가가 얼마나 많은 정답을 놓칠 수 있는가?
  • RQ2자동 평가 방법(BEM, InstructGPT-eval 등)과 인간 평가를 비교했을 때, 개방형 QA 모델의 성능 순위 평가에서 어떤 차이가 있는가?
  • RQ3정규표현식 일치가 어휘 일치 평가보다 더 민감하고 유연한 대안으로서 개방형 QA 평가에 신뢰할 수 있는가?
  • RQ4자동 평가 모델은 왜 LLM이 생성한 장문의 응답에서 환각 현상을 탐지하지 못하는가? 이는 성능 추정에 어떤 영향을 미치는가?
  • RQ5인간 평가를 기준으로 볼 때, 현대의 LLM 기반 QA 모델이 오래된 수작업 기반 통계 모델보다 진정으로 뛰어나다고 할 수 있는가?

주요 결과

  • InstructGPT(제로샷)는 NQ-open 서브셋에서 인간 평가 기준 71.4%의 정확도를 기록했으며, 어휘 일치 평가로 추정된 12.6%보다 약 60% 향상된 성능이다.
  • 어휘 일치 실패의 50% 이상이 의미적으로 동치적이지만 문법적으로 다른 응답으로 인한 것으로 밝혀져 의미 인식 평가의 필요성을 강조한다.
  • 정규표현식 일치는 인간 평가 결과와 일관된 순위를 도출하지만, 여전히 과도하게 엄격하여 평균 6.6%의 성능을 과소 평가한다.
  • BEM 및 InstructGPT-eval과 같은 자동 평가 모델은 LLM이 생성한 장문의 응답에서 환각 현상을 탐지하지 못해 모델 성능을 과대 평가한다.
  • 인간 평가 결과, InstructGPT(피셔샷)는 CuratedTREC 2002에서 92%의 정확도를 기록했으며, 이는 2002년 TREC 우승자인 LCCmain2002를 초월한 성능이다. 그러나 이는 자동 평가 지표에서는 반영되지 않았다.
  • 오직 인간 평가를 통해 LLM이 20년 전의 통계 모델인 LCCmain2002를 능가한다는 것이 드러났으며, 이는 복잡한 QA 환경에서 자동 평가가 진정한 모델 성능을 신뢰성 있게 반영하지 못함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.