[논문 리뷰] Capturing Failures of Large Language Models via Human Cognitive Biases
이 논문은 대형 언어 모델에서 질적 실패 모드를 이끌어내기 위한 인지 편향에서 영감을 받은 프레임워크를 제시하고, Codex, CodeGen, 그리고 GPT-3에 적용하여 파일 삭제와 같은 영향력이 큰 오류를 입증합니다.
Large language models generate complex, open-ended outputs: instead of outputting a class label they write summaries, generate dialogue, or produce working code. In order to asses the reliability of these open-ended generation systems, we aim to identify qualitative categories of erroneous behavior, beyond identifying individual errors. To hypothesize and test for such qualitative errors, we draw inspiration from human cognitive biases -- systematic patterns of deviation from rational judgement. Specifically, we use cognitive biases as motivation to (i) generate hypotheses for problems that models may have, and (ii) develop experiments that elicit these problems. Using code generation as a case study, we find that OpenAI's Codex errs predictably based on how the input prompt is framed, adjusts outputs towards anchors, and is biased towards outputs that mimic frequent training examples. We then use our framework to elicit high-impact errors such as incorrectly deleting files. Our results indicate that experimental methodology from cognitive science can help characterize how machine learning systems behave.
연구 동기 및 목표
- 코드와 언어 모델 같은 공개형 생성 시스템의 신뢰성 문제를 살펴보며 연구 동기를 제시합니다.
- 질적 오류 모드를 가설화하고 테스트하기 위한 인지 편향 기반 방법론을 도입합니다.
- Codex, CodeGen, GPT-3 전반에서 프레이밍 프레이밍 프레이밍 프레임워크를 통해 실패 모드를 유도하고 특성화합니다.
- 프레이밍, 고정화, 가용성 편향, 속성 대체 편향이 고충력 있는 오류를 유발할 수 있음을 보여줍니다.
제안 방법
- 의미를 보존하되 대상 오류를 촉발하는 프롬프트 변환으로 인지 편향을 변환합니다.
- 변환 후 기능적 정확도의 하락으로 모델 민감도를 측정합니다.
- 출력이 대상 실패의 명시적 지표(예: 무관한 정보에의 의존, 고정 효과)를 나타내는지 확인합니다.
- 코드 모델과 GPT-3에 프레이밍, 고정화, 가용성 휴리스틱, 속성 대체를 적용하여 특정 오류를 유도합니다.
- 블랙박스 프롬프트 기반 접근법을 사용합니다; 학습 데이터나 모델 매개변수에 대한 접근은 필요하지 않습니다.
실험 결과
연구 질문
- RQ1인지 편향이 공개형 생성 모델의 질적 실패 모드에 대한 가설을 제시할 수 있습니까?
- RQ2프레이밍, 고정화, 가용성, 속성 대체에서 영감을 받은 프롬프트 변환이 Codex, CodeGen, GPT-3에서 특정 실패를 체계적으로 드러낼 수 있습니까?
- RQ3이 프레임워크를 통해 고충력 있는 오류(예: 파괴적 코드 동작)들을 발견할 수 있습니까?
주요 결과
- 코드 생성 모델(Codex와 CodeGen)은 프레이밍되거나, 고정화되거나, 관련되지만 잘못된 프롬프트가 제시될 때 무관한 프롬프트 정보에 의존합니다.
- 고정화 및 가용성에서 영감을 받은 프롬프트는 산출물이 관련 해답이나 학습 데이터 빈도 패턴으로 이동하도록 만들어 정확성을 저하시킵니다.
- 속성 대체 프롬프트는 솔루션을 편향하는 간단한 휴리스틱(예: 함수 이름의 사용)을 드러냅니다.
- GPT-3은 인간과 유사한 질적 프레이밍 및 고정화 효과를 보이며 프레이밍 하에서 추정치나 선택이 예측 가능한 변화를 보입니다.
- 프레임워크는 Codex에서 파일 삭제와 같은 고충력 오류를 체계적으로 생성할 수 있어 위험한 오작동의 가능성을 강조합니다.
- 전반적으로 인지과학 기반 실험 방법론은 공개형 ML 시스템의 질적 실패를 모델에 독립적인 방식으로 특징화하는 실용적 방법을 제공합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.