[논문 리뷰] Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse
이 논문은 사고의 사슬(CoT) 프롬프팅이 언어 모델과 다중모态 모델에서 언어적 사고가 인간의 성능을 해칠 수 있는 과제, 특히 암묵적 통계적 학습, 시각적 인식 및 예외가 많은 분류 과제에서 성능을 떨어뜨릴 수 있음을 규명한다. 특히, 제로샷 추론 대비 정확도가 최대 36.3%까지 감소함을 보여주며, 인간의 인지심리학적 발견을 바탕으로 한 히ュ리스틱을 제안하여 이러한 실패 케이스를 예측할 수 있다.
Chain-of-thought (CoT) prompting has become a widely used strategy for improving large language and multimodal model performance. However, it is still an open question under which settings CoT systematically reduces performance. In this paper, we seek to identify the characteristics of tasks where CoT reduces performance by drawing inspiration from cognitive psychology, focusing on six representative tasks from the psychological literature where deliberation hurts performance in humans. In three of these tasks, state-of-the-art models exhibit significant performance drop-offs with CoT (up to 36.3\% absolute accuracy for OpenAI o1-preview compared to GPT-4o), while in others, CoT effects are mixed, with positive, neutral, and negative changes. While models and humans do not exhibit perfectly parallel cognitive processes, considering cases where thinking has negative consequences for humans helps identify settings where it negatively impacts models. By connecting the literature on human verbal thinking and deliberation with evaluations of CoT, we offer a perspective for understanding the impact of inference-time reasoning.
연구 동기 및 목표
- 사고의 사슬(CoT) 프롬프팅이 성능을 향상시키지 못하고 오히려 떨어뜨리는 설정을 규명하는 것.
- 언어적 사고가 인간의 성능을 떨어뜨리는 인지심리학적 발견이 LLM 및 VLM에서 유사한 실패를 예측할 수 있는지 탐색하는 것.
- 인간의 성능이 사고 과정에서 저하되는 조건(i)과 인간의 제약이 모델로 일반화되는 조건(ii)을 만족하는 과제가 CoT의 실패 케이스인지 테스트하는 것.
- CoT가 공통된 인지적 제약으로 인해 모델 성능을 떨어뜨리는 경우와 모델 능력이 인간의 제약과 다를 경우를 구분하는 것.
제안 방법
- 세 가지 과제는 인간의 성능 저하와 제약의 모델 일반화를 모두 만족하고, 세 가지 과제는 조건(i)만 만족하고 조건(ii)는 만족하지 못하는, 잘 연구된 심리학 과제 6개를 최신 LLM 및 VLM에 적용하여 평가하였다.
- 암묵적 통계적 학습, 얼굴 인식, 예외가 많은 분류와 같은 핵심 실패 과제에서 제로샷 추론 대비 CoT 프롬프팅의 성능을 평가하였다.
- 표준화된 벤치마크와 통제된 프롬프트 엔지니어링을 사용하여 CoT가 모델 정확도에 미치는 영향을 분리하고, 제로샷 기준선과 비교하였다.
- 사고의 나무와 같은 대안적 추론 기법을 확장 분석하여, 추론 시간의 추론 방법 전반에 걸쳐 성능 저하가 지속됨을 확인하였다.
- 인간의 인지심리학적 행동과 모델 행동을 연결하는 히ュ리스틱 프레임워크를 적용하여, 알려진 인간의 실패 케이스를 모델 실패 케이스 예측 도구로 사용하였다.
- 성능 차이의 원인이 구현 특이성에 기인한 것인지 제거하기 위해 광범위한 아블레이션 및 프롬프트 변형 연구를 수행하였다.
실험 결과
연구 질문
- RQ1어떤 과제에서 사고의 사슬 프롬프팅이 성능을 향상시키지 못하고 오히려 떨어뜨리는가?
- RQ2언어적 사고가 인간의 성능을 저하시키는 경우가 LLM 및 다중모달 모델에서 유사한 부정적 영향을 초래할 수 있는가?
- RQ3인간과 모델 간 공통된 인지적 제약이 특정 과제에서 CoT가 성능을 떨어뜨리는 이유를 설명할 수 있는가?
- RQ4인간과 모델의 사전 지식 또는 작업 기억 한계가 다른 과제에서는 CoT 프롬프팅에 대해 어떻게 다른 반응을 보이는가?
- RQ5사고의 나무와 같은 대안적 추론 기법이 표준 CoT에서 관찰된 부정적 영향을 얼마나 잘 재현하는가?
주요 결과
- 암묵적 통계적 학습 과제에서 CoT 프롬프팅은 모델 정확도를 최대 36.3%p까지 떨어뜨렸으며, OpenAI o1-preview는 제로샷 시 94.00%에서 CoT 시 57.70%로 감소하였다.
- 얼굴 인식 과제에서 GPT-4o는 CoT 적용으로 정확도가 21.8%p 감소하여 제로샷 82.5%에서 CoT 60.7%로 떨어졌다.
- 예외가 많은 분류 과제에서 LLaMA-3-70B는 CoT 적용으로 정확도가 18.5%p 감소하여 제로샷 85.2%에서 CoT 66.7%로 떨어졌다.
- 인간과 모델의 제약이 다른 과제(예: 작업 기억 한계)에서는 CoT가 성능을 떨어뜨리지 않았고, 때로는 향상시키기도 하여 실패가 반드시 일반화되지는 않음을 시사했다.
- 사고의 나무 프롬프팅 역시 암묵적 통계적 학습 과제에서 성능 복구에 실패하여 표준 CoT(62.52%)보다는 약간 높은 64.55%의 정확도를 기록했지만, 여전히 제로샷 기준선인 94.00%에는 훨씬 못 미쳤다.
- 광범위한 프롬프트 변형 연구를 통해 성능 저하의 원인이 구현 방식의 차이 때문이라는 증거는 발견되지 않았으며, 핵심 실패 과제에서의 부정적 영향은 다양한 프롬프트 설정에서도 여전히 지속되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.