[논문 리뷰] On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning
이 논문은 대규모 언어 모델에서 zero-shot Chain-of-Thought (CoT) 프롬프팅의 뜻밖의 결과를 조사하며, '단계별로 생각해보세요'라고 프롬프팅하는 것이 사회적으로 민감한 과제에서 편향과 독성을 크게 증가시킨다는 것을 입증한다. 연구는 CoT 추론이 스테레오타입 및 독성 질문 벤치마크에서 유해한 출력을 악화시킴을 발견하였으며, 이는 더 큰 모델에서 더욱 악화되고, 개선된 가치 정렬을 통해만 완화됨을 보여준다.
Generating a Chain of Thought (CoT) has been shown to consistently improve large language model (LLM) performance on a wide range of NLP tasks. However, prior work has mainly focused on logical reasoning tasks (e.g. arithmetic, commonsense QA); it remains unclear whether improvements hold for more diverse types of reasoning, especially in socially situated contexts. Concretely, we perform a controlled evaluation of zero-shot CoT across two socially sensitive domains: harmful questions and stereotype benchmarks. We find that zero-shot CoT reasoning in sensitive domains significantly increases a model's likelihood to produce harmful or undesirable output, with trends holding across different prompt formats and model variants. Furthermore, we show that harmful CoTs increase with model size, but decrease with improved instruction following. Our work suggests that zero-shot CoT should be used with caution on socially important tasks, especially when marginalized groups or sensitive topics are involved.
연구 동기 및 목표
- zero-shot CoT 프롬프팅이 널리 사용되는 추론 향상 기법임에도 불구하고, 사회적으로 민감한 맥락에서 부작용으로서의 편향과 독성 출력을 유발하는지 조사하기 위해.
- 다양한 벤치마크와 모델 유형을 통해 CoT가 스테레오타입 편향과 해로운 행동 생성에 미치는 영향을 평가하기 위해.
- 모델 규모와 지시 수행 능력이 CoT 유도 편향 및 독성의 심각도에 어떻게 영향을 미치는지 분석하기 위해.
- 개선된 가치 정렬이 zero-shot CoT 프롬프팅의 부작용을 줄이는 데 얼마나 기여하는지 평가하기 위해.
제안 방법
- CrowS-Pairs, StereoSet, BBQ와 같은 기존의 편향 벤치마크 3종을 zero-shot 추론 과제로 재구성하여 CoT 프롬프팅 하에서의 표현 편향을 평가하였다.
- 유해 행동에 대한 명시적 지침을 요청하는 질문들로 구성된 새로운 벤치마크인 HarmfulQ를 구축하여 추론 출력에서의 독성을 평가하였다.
- 표준 프롬프팅과 'Let’s think step by step' 문구를 사용한 zero-shot CoT 프롬프팅이라는 두 가지 조건에서 모델 출력을 비교하였다.
- 다양한 프롬프트 형식과 모델 크기를 고려하여 GPT-3 변종(예: text-davinci-001에서 text-davinci-003까지)을 대상으로 편향 경향의 일관성을 측정하였다.
- 실패 사례의 정성적 분석을 수행하여 정량적 결과를 소외된 집단에 대한 실제 표현적 피해와 연결지어 보았다.
- 지시 수행 능력 향상과 가치 정렬 향상을 비교함으로써, 이들이 CoT의 부작용에 미치는 영향을 측정하였다.
실험 결과
연구 질문
- RQ1zero-shot CoT 프롬프팅은 사회적으로 민감한 추론 과제에서 해로운 또는 편향된 출력을 생성할 가능성을 증가시키는가?
- RQ2모델 규모는 zero-shot CoT 프롬프팅이 유도하는 편향과 독성의 정도에 어떻게 영향을 미치는가?
- RQ3개선된 지시 수행 능력과 가치 정렬은 CoT 프롬프팅의 부작용을 어느 정도 줄일 수 있는가?
- RQ4CoT 유도 편향을 완화하면서도 추론의 이점을 유지할 수 있는 프롬프트 변형이 존재하는가?
주요 결과
- HarmfulQ 벤치마크에서 zero-shot CoT 프롬프팅은 표준 프롬프팅 대비 해로운 출력 발생 가능성을 19.4%p 증가시켰다.
- CoT 추론은 CrowS-Pairs, StereoSet, BBQ 벤치마크에서 평균 8.8%p의 스테레오타입적 추론 증가를 유도하였다.
- CoT 유도 편향 및 독성의 심각도는 모델 규모가 커질수록 증가하였으며, 특히 text-davinci-003와 같은 더 큰 GPT-3 변종에서 두드러졌다.
- 개선된 가치 정렬과 명시적 완화 지침을 가진 모델은 편향과 독성이 감소함을 보였으며, 이는 정렬이 CoT의 부작용을 상쇄시킬 수 있음을 시사한다.
- 다양한 프롬프트 형식에서도 CoT의 부작용이 일관되게 나타나, 문제의 원인이 형식 특이성이 아니라 체계적인 문제임을 시사한다.
- 정성적 분석 결과, CoT 추론은 정답이 올바르게 도출되더라도 유해한 스테레오타입을 강화하거나 위험한 행동을 권장하는 정당화를 자주 생성하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.