[논문 리뷰] Boosting Language Models Reasoning with Chain-of-Knowledge Prompting
이 논문은 체인 오브 지식(Chain-of-Knowledge, CoK) 프롬프팅을 소개하며, 텍스트적 설명과 함께 명시적이고 구조화된 지식 삼중항(증거적 사실)을 유도함으로써 대규모 언어 모델의 추론 능력을 향상시키는 방법을 제안한다. 외부 지식 기반을 통합하고 사실성과 충실도를 평가하기 위한 F²-검증 전략을 적용하여, 일반 지식, 사실 기반, 기호적, 산술적 과제 등 다양한 과제에서 추론의 신뢰성과 성능을 향상시킨다. 이는 표준적인 인라인 학습과 체인 오브 토의 프롬프팅을 능가한다.
Recently, Chain-of-Thought (CoT) prompting has delivered success on complex reasoning tasks, which aims at designing a simple prompt like ``Let's think step by step'' or multiple in-context exemplars with well-designed rationales to elicit Large Language Models (LLMs) to generate intermediate reasoning steps. However, the generated rationales often come with mistakes, making unfactual and unfaithful reasoning chains. To mitigate this brittleness, we propose a novel Chain-of-Knowledge (CoK) prompting, where we aim at eliciting LLMs to generate explicit pieces of knowledge evidence in the form of structure triple. This is inspired by our human behaviors, i.e., we can draw a mind map or knowledge map as the reasoning evidence in the brain before answering a complex question. Benefiting from CoK, we additionally introduce a F^2-Verification method to estimate the reliability of the reasoning chains in terms of factuality and faithfulness. For the unreliable response, the wrong evidence can be indicated to prompt the LLM to rethink. Extensive experiments demonstrate that our method can further improve the performance of commonsense, factual, symbolic, and arithmetic reasoning tasks.
연구 동기 및 목표
- 체인 오브 토의(Chain-of-Thought, CoT) 프롬프팅의 취약성 문제를 해결하기 위해, LLM이 사실이 되지 않거나 충실도가 떨어지는 추론 체인을 생성하는 것을 방지한다.
- 지식 삼중항 형태로 명시적으로 구조화된 지식 증거를 유도하여 LLM의 추론 신뢰성을 향상시킨다.
- 추론 체인의 사실성(기본 지식과의 일치성)과 충실도(텍스트적 설명 및 최종 답변과의 일致성)를 평가하기 위한 F²-검증 방법을 개발한다.
- 오류 있는 증거를 강조하여 신뢰할 수 없는 추론을 식별하고 수정할 수 있는 재고기반 메커니즘을 구현한다.
- 공동 지식, 사실 기반, 기호적, 산술적 추론 과제를 포함한 다양한 추론 벤치마크에서 CoK 프롬프팅의 효과성을 입증한다.
제안 방법
- CoK 프롬프팅은 두 가지 구성요소를 통합한다: 지식 삼중항(Chain-of-Knowledge-Evidence Triples, CoK-ET)은 (주어, 관계, 목적어) 형태의 구조화된 지식 사실이며, 설명 힌트(Chain-of-Knowledge-Explanation Hints, CoK-EH)는 추론 체인을 뒷받침하는 텍스트적 근거를 제공한다.
- 인라인 예시는 레이블이 부여된 예제를 샘플링하고, 추론을 유도하기 위해 '한 번에 한 단계씩 생각해 봅시다' 프롬프트를 추가한 후, 외부 지식 기반에서 관련 지식 삼중항을 검색하고 수동으로 애너테이션한다.
- F²-검증 전략은 두 가지 신뢰성 지표를 정량화한다: 사실성(추론 증거와 기준 지식 간 일치성)과 충실도(증거와 텍스트적 설명 및 최종 답변 간 일致성).
- 신뢰할 수 없는 출력의 경우 F²-검증은 잘못된 증거를 식별하고, 이를 바탕으로 LLM이 추론을 재수정하도록 유도하는 재고 과정을 유도한다.
- 파라미터 미튜닝 없이, Zero-shot Few-shot 설정에서 CoK-구조화된 인라인 예시에 기반해 LLM을 조건화함으로써 이 방법을 적용한다.
- 재고 과정은 식별된 오류 있는 증거를 바탕으로 LLM이 수정된 추론 체인을 생성하도록 유도하여 최종 답변 정확도를 향상시킨다.

실험 결과
연구 질문
- RQ1표준 체인 오브 토의 프롬프팅 대비, 구조화된 지식 삼중항이 LLM 추론의 사실성과 충실도를 향상시키는가?
- RQ2F²-검증 전략은 증거 품질에 기반해 불신뢰할 수 있는 추론 체인을 효과적으로 탐지하는가?
- RQ3CoK 프롬프팅은 공통 지식, 사실 기반, 기호적, 산술적 추론과 같은 다양한 추론 과제에서 측정 가능한 성능 향상을 이끌어내는가?
- RQ4F²-검증에 기반한 재고 기반 메커니즘이 잘못된 추론을 효과적으로 수정하고 정답 정확도를 향상시키는가?
- RQ5파rameter 업데이트 없이 CoK 프롬프팅은 환상적 또는 일관성 없는 추론을 얼마나 줄이는가?
주요 결과
- CoK 프롬프팅은 공통 지식 추론 과제에서 표준 인라인 학습 및 체인 오브 토의 프롬프팅을 능가하는 성능 향상을 크게 보였다.
- 사실 기반 추론 벤치마크에서 CoK는 명시적 지식 삼중항 통합을 통해 사실이 되지 않는 추론 체인을 줄여 더 높은 정확도를 달성했다.
- F²-검증 방법은 불신뢰할 수 있는 추론 체인을 성공적으로 식별하였으며, 사실이 잘못된 증거와 일관성이 없는 설명을 모두 탐지하는 데 집중했다.
- F²-검증에 기반한 재고 과정은 잘못된 추론 경로를 수정함으로써 더 높은 정답 정확도를 달성했다.
- 산술 및 기호적 추론 과제에서는 CoK가 특히 증거와 결론 간 논리적 일관성을 유지함으로써 뛰어난 강건성과 신뢰성을 보였다.
- 실증 결과는 StrategyQA를 포함한 여러 데이터셋에서 일관된 성과 향상을 보였으며, 이는 다양한 추론 유형으로의 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.