[논문 리뷰] Prompting is not a substitute for probability measurements in large language models
이 논문은 메타언어적 프롬프팅—언어 모델 지식을 평가하기 위해 자연어 질의를 사용하는 방식—이 모델 로짓에서 직접 측정한 확률보다 정확도와 일관성이 떨어진다는 것을 입증한다. 저자들은 LLM이 프롬프팅에 응답할 때 내부 확률 분포와 다를 수 있음을 발견하여, 언어 평가에서 직접 측정의 대체로 프롬프팅을 사용하는 것이 타당성이 떨어진다는 것을 밝혀냈다.
Prompting is now a dominant method for evaluating the linguistic knowledge of large language models (LLMs). While other methods directly read out models' probability distributions over strings, prompting requires models to access this internal information by processing linguistic input, thereby implicitly testing a new type of emergent ability: metalinguistic judgment. In this study, we compare metalinguistic prompting and direct probability measurements as ways of measuring models' linguistic knowledge. Broadly, we find that LLMs' metalinguistic judgments are inferior to quantities directly derived from representations. Furthermore, consistency gets worse as the prompt query diverges from direct measurements of next-word probabilities. Our findings suggest that negative results relying on metalinguistic prompts cannot be taken as conclusive evidence that an LLM lacks a particular linguistic generalization. Our results also highlight the value that is lost with the move to closed APIs where access to probability distributions is limited.
연구 동기 및 목표
- 메타언어적 프롬프팅이 대규모 언어 모델(LLM)의 언어 지식을 신뢰성 있게 측정하는지 평가하는 것.
- 모델 로짓에서 직접 측정한 확률과 메타언어적 프롬프팅 간의 정확도와 일관성의 차이를 비교하는 것.
- 내부 확률 분포에 접근할 수 없는 폐쇄형 API에 의존할 경우 발생하는 위험을 부각하는 것.
- 과학적 평가에서 직접 측정의 대체로 프롬프팅을 사용해서는 안 된다는 주장을 펼치는 것.
제안 방법
- 이 연구는 모델 로짓에서 P(토큰|컨텍스트)를 추출하는 직접적 확률 측정 방식과, 언어적 타당성이나 가능성에 대해 자연어로 질의하는 메타언어적 프롬프팅 방식을 비교한다.
- 주어진 작업 영역에 따라 주어진 언어적 영역에서 다양한 실험을 수행하였으며, 주로 주어-동사 일치, 관계절 첨부, 의미적 타당성 등을 포함한다.
- 각 작업에서 메타언어적 프롬프팅에 대한 모델의 응답(예: '다음에 올 가장 가능성이 높은 단어는 무엇입니까?')을 후보 완성에 대한 실제 확률 분포와 비교하였다.
- 저자들은 GPT-3, GPT-3.5, LLaMA 등 다양한 모델을 대상으로 제로샷 프롬프팅과 직접 로짓 접근을 사용하여 방법론적 일관성을 확보하였다.
- 두 방법 간의 순서가 일치하는 정도를 측정하기 위해 후보 완성의 순위를 비교함으로써 일관성을 정량화하였다.
- 모든 실험은 여러 모델과 프롬프트를 대상으로 반복되었으며, 코드와 데이터는 공개되었다.

실험 결과
연구 질문
- RQ1메타언어적 프롬프팅의 응답은 LLM의 내부 표현에 대한 직접적 확률 측정에 비해 얼마나 정확한가?
- RQ2프롬프트의 구조가 메타언어적 프롬프팅과 직접적 확률 측정 간의 일관성에 어느 정도 영향을 미치는가?
- RQ3메타언어적 프롬프팅에서의 성능은 모델의 진정된 언어적 능력을 반영하는가, 아니면 잠재적인 성능 관련 능력에 기인하는가?
- RQ4프롬프팅에서의 부정적 결과—예를 들어 문법적으로 올바른 문장 구조를 기각하는 것—은 LLM이 특정 언어 일반화를 갖지 못한다는 증거로 간주될 수 있는가?
- RQ5폐쇄형 API로 인해 내부 확률 분포에 접근할 수 없게질 경우, 언어 평가의 타당성은 어떻게 영향을 받는가?
주요 결과
- 메타언어적 프롬프팅은 희귀하거나 복잡한 언어 패턴에 대해 직접적 확률 측정보다 유의미하게 정확도가 낮은 평가를 이끌어낸다.
- 프롬프트의 구조가 직접적 확률 질의에서 벗어날수록 메타언어적 프롬프팅과 직접적 확률 측정 간의 일관성이 감소한다.
- 내부 확률 분포가 명백히 특정 토큰을 선호함에도 불구하고, 모델은 종종 프롬프팅 작업에서 가장 가능성이 높은 다음 단어를 올바르게 보고하지 못한다.
- 프롬프팅과 직접 측정 간의 격차는 모델의 표현 능력 부족 때문이 아니라, 메타언어적 질의 상황에서 내부 지식에 접근하고 이를 보고하는 능력의 부족 때문임을 밝혀냈다.
- 이 연구는 프롬프팅에서의 부정적 결과—예를 들어 문법적으로 올바른 문장 구조를 기각하는 것—이 언어적 무능력의 결정적 증거로 간주될 수 없다는 것을 입증하였다.
- 저자들은 모델 내부 접근이 제한된 상황에서는 과학적 연구에서 직접적 확률 측정의 대체로 프롬프팅을 사용해서는 안 된다고 결론 내렸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.