[논문 리뷰] What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering
이 논문은 텍스트 분류 작업에서 프롬프트 변형에 대한 대규모 언어 모델(Large Language Models, LLMs)의 성능 신뢰성을 평가하기 위해 두 가지 새로운 지표인 민감도(sensitivity)와 일관성(consistency)을 도입한다. 민감도는 지도 학습이 필요 없이 의미적으로 동일한 프롬프트 재구성에서 예측의 변화를 측정하며, 일관성은 동일한 클래스 내에서 레이블 안정성을 평가한다. 주요 기여는 LLM의 실패 유형을 진단하고, 특히 다수의 LLM 단계를 거치는 생산 환경에서의 내성 강화를 위한 프롬프트 엔지니어링을 안내하는 진단 프레임워크를 제공한다는 점이다.
Large Language Models (LLMs) changed the way we design and interact with software systems. Their ability to process and extract information from text has drastically improved productivity in a number of routine tasks. Developers that want to include these models in their software stack, however, face a dreadful challenge: debugging LLMs' inconsistent behavior across minor variations of the prompt. We therefore introduce two metrics for classification tasks, namely sensitivity and consistency, which are complementary to task performance. First, sensitivity measures changes of predictions across rephrasings of the prompt, and does not require access to ground truth labels. Instead, consistency measures how predictions vary across rephrasings for elements of the same class. We perform an empirical comparison of these metrics on text classification tasks, using them as guideline for understanding failure modes of the LLM. Our hope is that sensitivity and consistency will be helpful to guide prompt engineering and obtain LLMs that balance robustness with performance.
연구 동기 및 목표
- 소량의 프롬프트 변화에 의해 발생하는 LLM의 불일관된 행동 문제를 해결하여, 생산 환경에의 도입을 방해하는 요인을 제거한다.
- 지표 학습이 필요 없이 LLM의 내성 수준을 평가할 수 있는 진단 지표를 개발한다.
- 과민도나 낮은 일관성과 같은 실패 유형을 식별하여 프롬프트 엔지니어링을 안내한다.
- 프롬프트 변형이 흔한 다단계 소프트웨어 시스템에서 LLM의 신뢰성 평가를 위한 프레임워크를 제공한다.
제안 방법
- 동일한 프롬프트의 Q개의 재구성에 대해 예측 분산을 측정하는 민감도를 지표로 제안하며, 지도 학습 없이 계산한다.
- 예측 분포 간 코사인 유사도를 사용하여, 동일한 클래스의 예시들 간 예측의 평균 유사도로 일관성을 정의한다.
- 소수 샘플, 제로 샘플, 세부 설명 등의 다양한 프롬프팅 전략을 사용하여, TREC, DBPedia, WoS, CB 등의 다수의 텍스트 분류 데이터셋에서 LLM을 평가한다.
- Llama3와 GPT-3.5에 지표를 적용하여 집합적 및 클래스별 행동을 분석하여 실패 패tern을 탐지한다.
- 히스토GRAM과 바이올린 플롯을 사용하여, 다양한 프롬프팅 기법과 데이터셋 간 일관성 분포를 비교한다.
- 정성적 분석을 통해 예측 오류가 레이블 설명의 어조나 순서와 같은 특정 프롬프트 설계 선택에 기인함을 추적한다.
실험 결과
연구 질문
- RQ1의미적으로 동일한 프롬프트 재구성 간 LLM의 예측은 어떻게 변하는가? 이 변화는 지도 학습 없이도 정량화할 수 있는가?
- RQ2다양한 프롬프팅 전략은 동일한 클래스 내에서 LLM 예측의 일관성에 어느 정도 영향을 미치는가?
- RQ3민감도와 일관성 지표는 정확도로는 포착되지 않는 실패 유형을 식별할 수 있는가?
- RQ4레이블 설명의 어조와 순서는 LLM의 내성에 어떤 영향을 미치며, 이러한 요소들은 체계적으로 진단할 수 있는가?
주요 결과
- 민감도는 정확도가 높아도 LLM의 예측이 극적으로 변화하는 프롬프트 변형을 효과적으로 식별하며, 모델 행동의 숨겨진 취약성을 드러낸다.
- 일관성 값은 일반적으로 클래스 간 0.75 이하였으며, 이는 LLM이 유사한 예시를 자주 다르게 분류함을 시사한다. 특히 'Description'과 'Entity'와 같은 혼동이 쉬운 클래스에서 두드러진다.
- 1-shot 프롬프팅 전략은 중간 수준의 일관성을 감소시키고, 일관성이 0인 쌍의 수를 증가시켜, 소수 샘플 전략이 안정성을 향상시킨다는 기대와는 정반대의 결과를 보였다.
- 레이블 설명의 어조, 예를 들어 'an Entity'와 같은 冠접사의 추가는 예측에 상당한 영향을 미치며, 미세한 프롬프트 변경에 매우 민감함을 보여준다.
- 정성적 분석을 통해 'Description'과 'Entity' 간의 클래스 혼동이 흔하며, 이러한 클래스에 대해 프롬프트 설명을 조정함으로써 일관성이 향상됨을 확인했다.
- 지표들은 정확도 평균 외에 비직관적인 행동을 드러내었으며, 예를 들어 세부적인 클래스 설명을 사용할 경우 민감도가 증가하는 현상이 관찰되어, 평균 성능 외에도 체계적인 프롬프트 진단의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.