[논문 리뷰] Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
이 논문은 지식 집약적인 작업을 위한 대규모 언어 모델(Large Language Models, LLMs)을 향상시키기 위해 동적이고 트리 구조의 추론 과정을 통해 상호작용형 검색을 통합하는 SearChain(SearChain)이라는 프레임워크를 제안한다. SearChain는 LLM이 전역적인 질문 연쇄(Chain-of-Query, CoQ)를 생성하도록 하여, 정보 검색(IR)이 신뢰도 기반 피드백을 통해 답변을 검증하고 수정하거나 부족한 지식을 보완함으로써 정확도, 신뢰성 및 추적 가능성을 향상시킨다. 이는 다단계 질문 응답, 사실 확인 및 장문 생성 작업에서 기존의 기준들보다 뛰어난 성능을 보인다.
Making the content generated by Large Language Model (LLM), accurate, credible and traceable is crucial, especially in complex knowledge-intensive tasks that require multi-step reasoning and each step needs knowledge to solve. Retrieval-augmented generation is good potential to solve this problem. However, where and how to introduce Information Retrieval (IR) to LLM is a big challenge. Previous work has the problems that wrong knowledge retrieved by IR misleads the LLM and interaction between IR and LLM breaks the reasoning chain of LLM. This paper proposes a novel framework named extbf{Search-in-the-Chain} (SearChain) for the interaction between LLM and IR to solve the challenges. First, LLM generates the reasoning chain named Chain-of-Query (CoQ) where each node consists of an IR-oriented query-answer pair. Second, IR verifies the answer of each node of CoQ. It corrects the answer that is not consistent with the retrieved information when IR gives high confidence, which improves the credibility. Third, LLM can indicate its missing knowledge in CoQ and rely on IR to provide this knowledge to LLM. These operations improve the accuracy in terms of reasoning and knowledge. Finally, SearChain generates the reasoning process and marks references to supporting documents for each reasoning step, which improves traceability. Interaction with IR in SearChain forms a novel reasoning path based on a tree, which enables LLM to dynamically modify the direction of reasoning. Experiments show that SearChain outperforms state-of-the-art baselines on complex knowledge-intensive tasks including multi-hop Q\&A, slot filling, fact checking, and long-form Q\&A.
연구 동기 및 목표
- 다단계 지식 집약적 추론 과정에서 기존의 검색 보강 LLM이 추론 체인의 통합성을 유지하지 못하거나 환영을 유도하는 문제를 해결한다.
- 고신뢰도 증거가 출력과 모순될 경우 IR을 통해 LLM의 답변을 검증하고 수정함으로써 LLM 생성 콘텐츠의 신뢰성을 향상시킨다.
- LLM이 명시적으로 표시할 때만 IR이 부족한 정보를 공급함으로써 지식 획득을 향상시키며, 모델을 오도할 위험을 줄인다.
- 각 추론 단계에 지원 문서에 대한 참조를 표시함으로써 추적 가능성을 높이고, 생성된 콘텐츠의 세밀한 감사 가능성을 보장한다.
- 선형 체인에서 트리 구조로의 추론 구조를 전환하여, IR 피드백에 기반해 LLM이 추론 경로를 동적으로 수정할 수 있도록 한다.
제안 방법
- 각 노드에 IR 최적화된 질의, LLM이 생성한 답변, 외부 지식이 필요한지 여부를 나타내는 플래그가 포함된 질문 연쇄(Chain-of-Query, CoQ)를 제안한다.
- LLM과 IR 간의 다단계 상호작용 루프를 도입한다: 각 라운드에서 IR은 외부 지식을 사용해 답변을 검증하고, 신뢰도가 높을 경우 수정 사항이나 누락된 사실을 제공한다.
- IR의 신뢰도 점수와 CoQ 플래그를 사용해 LLM의 답변을 수정할지 또는 부족한 지식을 공급할지 결정함으로써, 관련성 있고 신뢰할 수 있는 정보만 주입되도록 보장한다.
- 수정 또는 보완 정보를 수신한 후 LLM이 새로운 분기로 CoQ를 재생성할 수 있도록 하여, 추론 구조를 선형 체인에서 트리로 전환함으로써 동적 경로 수정이 가능하게 한다.
- 각 추론 단계에 지원 문서에 대한 참조가 포함된 최종 출력을 생성함으로써 투명성과 감사 가능성을 향상시킨다.
- LLM이 IR 상호작용을 시작하기 전에 전역적 추론 경로를 계획할 수 있도록 인라인 학습을 활용함으로써 추론의 일관성과 확장성을 향상시킨다.
실험 결과
연구 질문
- RQ1추론 체인을 손상시키거나 환영을 유도하는 지식 집약적 추론 과정에서 검색을 어떻게 통합할 수 있는가?
- RQ2신뢰도 기반 IR 피드백이 다단계 추론 과제에서 LLM 생성 답변의 신뢰성 향상에 기여할 수 있는가?
- RQ3상호작용형 검색은 다단계 질문 응답 및 사실 확인과 같은 복잡한 지식 집약적 과제에서 LLM의 정확도를 어느 정도 향상시킬 수 있는가?
- RQ4SearChain의 트리 구조 추론은 선형 체인과 비교해 해결되지 않은 부분 질문이나 추론 정체 상황을 다루는 데 얼마나 효과적인가?
- RQ5SearChain는 각 추론 단계에 지원 문서에 대한 참조를 표시함으로써 세밀한 추적 가능성을 달성할 수 있는가?
주요 결과
- SearChain는 다단계 질문 응답, 슬롯 채우기, 사실 확인 및 장문 질문 응답 과제에서 기준들보다 뛰어난 정확도와 추론의 강건성을 보이며 성능을 뛰어나게 한다.
- Musique 데이터셋에서 SearChain는 2-홉, 3-홉, 4-홉 질문에 대해 각각 평균 4.16, 4.66, 5.06개의 추론 단계를 기록하여 질문 복잡도를 더 잘 인식하고 있음을 나타낸다.
- SearChain는 IR이 LLM 성능에 악영향을 미치는 것을 줄였다: IR 통합 후 잘못된 답변을 낸 질문은 전체의 1.2%에 불과하여 오도되는 검색의 영향을 효과적으로 완화했다.
- 추적 가능성 평가에서 SearChain는 모든 정확한 CoQ 노드에 참조를 표시했고, New Bing는 모든 지식 소스를 커버하지 못했으며 때로는 관련 문서를 놓쳤다.
- 입력 토큰 수와 상호작용 라운드 수의 증가가 매우 미미하여 계산 오버헤드가 관리 가능함을 보였고, 이는 효율성을 입증한다.
- 사례 연구에서 SearChain는 CoT 및 Self-Ask가 자주 조기에 종료하는 것과 달리, 해결되지 않은 부분 질문을 재작성함으로써 계속해서 추론을 수행하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.