Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Consistency for Assuring Reliability of Large Language Models

Harsh Raj, Vipul Gupta|arXiv (Cornell University)|2023. 08. 17.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 개방형 텍스트 생성에서 대규모 언어 모델(Large Language Models, LLMs)을 평가하기 위한 새로운 의미적 일致성 지표를 제안하며, 어휘 유사도를 넘어서 진정한 의미적 동치성을 포착한다. Ask-to-Choose(A2C) 프롬프팅 전략을 도입하여 TruthfulQA에서 정확도를 최대 47% 향상시키고 의미적 일치성을 최대 7배로 높이며, 인간 평가와 강한 일치를 보이며 기존의 전통적 지표를 뛰어넘는 성능을 보인다.

ABSTRACT

Large Language Models (LLMs) exhibit remarkable fluency and competence across various natural language tasks. However, recent research has highlighted their sensitivity to variations in input prompts. To deploy LLMs in a safe and reliable manner, it is crucial for their outputs to be consistent when prompted with expressions that carry the same meaning or intent. While some existing work has explored how state-of-the-art LLMs address this issue, their evaluations have been confined to assessing lexical equality of single- or multi-word answers, overlooking the consistency of generative text sequences. For a more comprehensive understanding of the consistency of LLMs in open-ended text generation scenarios, we introduce a general measure of semantic consistency, and formulate multiple versions of this metric to evaluate the performance of various LLMs. Our proposal demonstrates significantly higher consistency and stronger correlation with human evaluations of output consistency than traditional metrics based on lexical consistency. Finally, we propose a novel prompting strategy, called Ask-to-Choose (A2C), to enhance semantic consistency. When evaluated for closed-book question answering based on answer variations from the TruthfulQA benchmark, A2C increases accuracy metrics for pretrained and finetuned LLMs by up to 47%, and semantic consistency metrics for instruction-tuned models by up to 7-fold.

연구 동기 및 목표

  • 단일 토큰 출력을 초과하여 의미적 일치성 평가가 부족한 LLM 생성 텍스트 시퀀스에 대한 보다 견고한 평가가 부족한 문제를 해결하기 위해.
  • 다양한 재구성된 프롬프트 간 의미적 동치성을 포착할 수 있는 일반화 가능한 지표를 개발하여 실제 자연어 생성(NLG) 응용에서의 신뢰도를 향상시키기 위해.
  • 일반적으로 상관관계가 있다고 여겨지는 정확도와 일치성 간의 괴리 현상을 탐구하기 위해.
  • 사실적 정확성을 훼손하지 않으면서도 의미적 일치성과 정확도를 모두 향상시킬 수 있는 프롬프팅 전략을 설계하기 위해.
  • 제안된 지표와 방법이 인간 평가 및 기존의 어휘 기반 지표와의 비교를 통해 검증되도록 하기 위해.

제안 방법

  • few-shot 프롬프팅을 활용한 컨텍스트 기반 학습을 통해 다양한 재구성된 질문을 생성하고, 짧은 답변을 추출하는 다단계 LLM 기반 파이프라인을 제안한다.
  • 다양한 의미적 일치 함수(예: 함의, 어색한 표현, BLEURT)를 사용하여 생성된 답변 간의 쌍별 의미적 동치성을 평가하기 위해 보조 LLM을 활용한다.
  • 누적된 쌍별 의미적 동치성 기반으로 일반화된 의미적 일치성 지표를 정의하여 다양한 LLM 아키텍처와 디코딩 전략 간 평가가 가능하게 한다.
  • 의미적 일치성과 정확도를 향상시키기 위해 선택지를 명시적으로 프레임화하는 방식으로 모델이 일관되고 정확한 답변을 도출하도록 유도하는 Ask-to-Choose(A2C) 프롬프팅 전략을 도입한다.
  • 의미 일치성 프레임워크 내에서 의미 일치 함수의 다양성(예: 어색한 표현, 함의, 모순, 어휘 기반 지표)을 활용하여 지표의 강건성과 인간 선호도와의 일치도를 평가한다.
  • 질문당 6개의 LLM 호출을 포함하는 인fer런스 파이프라인을 활용하여 최종 일치성 점수를 계산하며, 답변 생성, 요약, 의미 평가 단계를 거친다.

실험 결과

연구 질문

  • RQ1어휘 유사도를 넘어서 LLM 생성 텍스트 시퀀스의 의미적 일치성을 더 효과적으로 측정할 수 있는 방법은 무엇인가?
  • RQ2의미적 일치성은 인간이 평가한 출력 유사성과 어느 정도 상관관계가 있는가?
  • RQ3프롬프팅 전략을 통해 LLM의 정확도와 의미적 일치성을 동시에 향상시킬 수 있으며, 사실적 정확성을 손상시키지 않을 수 있는가?
  • RQ4LLM에서 정확도와 일치성 간에 괴리 현상이 존재하는가? 만약 그렇다면, 아키텍처나 프롬프팅 개선을 통해 이를 보완할 수 있는가?
  • RQ5함의, 어색한 표현 등 다양한 의미 일치 함수는 의미 일치성 측정과 인간 선호도 일치도에서 어떻게 비교되는가?

주요 결과

  • 더 큰 LLM일수록 높은 의미적 일치성을 보이지만, 동시에 정확도가 크기에 따라 감소하는 역방향 스케일링 효과를 보인다.
  • 의미적 일치성과 정확도는 상호 독립적인 성질이며, 모델은 일관성은 있지만 정확도가 떨어지거나, 정확도는 있지만 일관성이 떨어지는 경우가 존재한다.
  • 제안된 의미적 일치성 지표는 기존의 BLEU나 ROUGE와 같은 어휘 기반 지표보다 인간 평가와 훨씬 더 높은 상관관계를 보인다.
  • Ask-to-Choose(A2C) 프롬프팅 전략은 지침 기반 미리 훈련된 모델에서 정확도를 최대 47% 향상시키고 의미적 일치성을 최대 7배로 높인다.
  • A2C 적용 후 정확한 답변에 대한 일치성 점수는 높거나 향상되며, PP 지표는 다양한 모델에서 0.87에서 0.88로 상승한다.
  • 인간 평가와 의미적 일치성 지표 간의 쌍별 상관관계는 강력한 편이며, 특히 함의 및 어색한 표현 함수의 경우 높은 일치도를 유지한다. A2C 적용 후 엔트로피 지표의 상관관계는 약간 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.