Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring Reliability of Large Language Models through Semantic Consistency

Harsh Raj, Domenic Rosati|arXiv (Cornell University)|2022. 11. 10.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 자유형 텍스트 생성에서 대규모 언어 모델(Large Language Models, LLMs)을 평가하기 위한 의미 일致성 척도를 제안한다. 기존의 어휘 일치 기반 평가 방식을 의미적 동치성 함수(예: 동의어 표현 탐지 및 자연어 추론)로 대체한다. 이 방법은 어휘 기반 척도보다 인간 평가와 유의미하게 높은 상관관계를 보이며, 일관성 저하의 주요 원인이 모델 크기나 정확도가 아니라 디코딩 전략임을 드러낸다.

ABSTRACT

While large pretrained language models (PLMs) demonstrate incredible fluency and performance on many natural language tasks, recent work has shown that well-performing PLMs are very sensitive to what prompts are feed into them. Even when prompts are semantically identical, language models may give very different answers. When considering safe and trustworthy deployments of PLMs we would like their outputs to be consistent under prompts that mean the same thing or convey the same intent. While some work has looked into how state-of-the-art PLMs address this need, they have been limited to only evaluating lexical equality of single- or multi-word answers and do not address consistency of generative text sequences. In order to understand consistency of PLMs under text generation settings, we develop a measure of semantic consistency that allows the comparison of open-ended text outputs. We implement several versions of this consistency metric to evaluate the performance of a number of PLMs on paraphrased versions of questions in the TruthfulQA dataset, we find that our proposed metrics are considerably more consistent than traditional metrics embodying lexical consistency, and also correlate with human evaluation of output consistency to a higher degree.

연구 동기 및 목표

  • 자유형 텍스트 생성에서 어휘 일치 기반 평가가 의미적 동치성을 포착하지 못하는 데 기인한 신뢰할 수 있는 일관성 평가의 부족을 해결하기 위해.
  • 정확한 토큰 일치를 초월해 진정한 의미적 일치를 측정할 수 있도록 일반화된 의미 일관성 프레임워크를 개발하기 위해.
  • 모델 아키텍처, 크기, 디코딩 전략이 자연어 생성에서의 일관성에 미치는 영향을 평가하기 위해.
  • 제안된 척도를 인간 평가와 비교하고 기존의 어휘 기반 일관성 측정 방식과 대비하여 검증하기 위해.

제안 방법

  • 정확한 토큰 일치를 의미 일치 함수 f(y_i, y_j)로 대체하는 일반화된 일관성 척도 Cons_sem(Y)를 제안하며, 이는 출력 간 의미적 동치성을 측정한다.
  • 네 가지 의미 일치 함수를 구현: 의미 유사도 측정을 위한 BERTScore, 동의어 표현 탐지(PP), MNLI에 대해 미세조정된 DeBERTa-v2-xxlarge를 활용한 추론/모순 분류.
  • TruthfulQA 데이터셋의 재구성된 질문들을 활용해 다양한 LLMs(예: OPT, LLaMA)와 다양한 디코딩 전략을 적용하여 평가한다.
  • 인간 평가 결과와의 상관관계를 평가하기 위해 스피어만 상관계수를 사용한다.
  • 다중 척도 평가 전략을 도입하여 의미 척도(PP, 추론, BERTScore)를 어휘 기반 기준(ROUGE-1, NER)과 비교한다.
  • 재현성과 벤치마킹을 위해 재구성된 TruthfulQA 질문의 새로운 데이터셋을 제안한다.

실험 결과

연구 질문

  • RQ1의미 일관성 척도는 인간 평가의 일관성에 대해 어휘 기반 척도보다 얼마나 잘 상관관계를 보이는가?
  • RQ2모델 크기가 자유형 텍스트 생성에서 의미 일관성에 어느 정도 영향을 미치는가?
  • RQ3다양한 디코딩 전략(예: 탐색적 vs. nucleus 샘플링)은 의미 일관성에 어떤 영향을 미치는가?
  • RQ4정확도와 일관성은 LLM에서 상호 독립적인 성질인가, 아니면 상관관계가 있는가?

주요 결과

  • 추론 기반 일관성 척도가 인간 평가와 가장 높은 상관관계(ρ = 0.70)를 보였으며, ROUGE-1(ρ = 0.32) 및 NER(ρ = 0.15)와 같은 어휘 기반 척도보다 유의미하게 뛰어났다.
  • 동의어 표현 탐지(PP)와 BERTScore 역시 인간 평가 점수와 중간에서 강한 상관관계(각각 ρ = 0.52 및 ρ = 0.54)를 보이며, 의미 일관성을 효과적으로 포착할 수 있음을 시사한다.
  • 모든 의미 일관성 척도에서 탐색적 디코딩이 nucleus 샘플링보다 유의미하게 더 높은 일관성을 보였으며, 이는 디코딩 전략이 일관성 저하의 주요 원인임을 강조한다.
  • 모델 크기와 정확도는 일관성과 상관관계가 없으며, 크기가 클수록 일관성이 높아지지만 정확도는 크기가 증가함에 따라 감소(역비례 스케일링)하므로 이는 상호 독립적인 성질임을 시사한다.
  • ROUGE-1 및 NER와 같은 어휘 기반 척도는 인간 평가와 약한 상관관계(ρ ≤ 0.32)를 보이며, 의미 일관성의 대체 척도로는 부적절하다.
  • 특히 추론 및 동의어 표현 탐지 기반으로 구성된 제안된 의미 일관성 프레임워크는 텍스트 생성에서 LLM의 신뢰성 평가에 더 신뢰할 수 있고 인간 평가와 일치하는 방식을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.