[논문 리뷰] Context Tuning for Retrieval Augmented Generation
이 논문은 애매하거나 부족한 질의에서 의미적 검색이 실패하는 상황에서 부족한 맥락을 사전에 검색함으로써 도구 검색 및 계획 수립 정확도를 향상시키는 새로운 구성요소인 컨텍스트 튜닝(Context Tuning)을 소개한다. 경량 RRF-LambdaMART 모델을 활용해 수치적, 범주형, 사용 패턴 기반 신호를 통합함으로써, 맥락 검색의 Recall@K에서 3.5배 향상되고 계획 수립 정확도가 11.6% 향상되어 GPT-4 기반 검색 시스템조차도 능가한다.
Large language models (LLMs) have the remarkable ability to solve new tasks with just a few examples, but they need access to the right tools. Retrieval Augmented Generation (RAG) addresses this problem by retrieving a list of relevant tools for a given task. However, RAG's tool retrieval step requires all the required information to be explicitly present in the query. This is a limitation, as semantic search, the widely adopted tool retrieval method, can fail when the query is incomplete or lacks context. To address this limitation, we propose Context Tuning for RAG, which employs a smart context retrieval system to fetch relevant information that improves both tool retrieval and plan generation. Our lightweight context retrieval model uses numerical, categorical, and habitual usage signals to retrieve and rank context items. Our empirical results demonstrate that context tuning significantly enhances semantic search, achieving a 3.5-fold and 1.5-fold improvement in Recall@K for context retrieval and tool retrieval tasks respectively, and resulting in an 11.6% increase in LLM-based planner accuracy. Additionally, we show that our proposed lightweight model using Reciprocal Rank Fusion (RRF) with LambdaMART outperforms GPT-4 based retrieval. Moreover, we observe context augmentation at plan generation, even after tool retrieval, reduces hallucination.
연구 동기 및 목표
- 의미적 검색이 부족한 맥락으로 인해 실패하는 전통적인 RAG의 한계를 해결하기 위해, 암시적 또는 미흡하게 기술된 질의를 처리할 수 있도록 하는 것.
- 관련 맥락 신호를 검색함으로써 도구 검색 및 계획 수립을 향상시키는 컨텍스트 튜닝 구성요소를 설계하는 것.
- CoT 증강 및 미세조정된 모델을 포함한 다양한 맥락 검색 방법을 독립적 및 조합적으로 실험적으로 평가하고 비교하는 것.
- 미세조정된 검색 모델이 CoT 증강이 필요 없음을 입증함으로써 입력 길이를 단축하면서도 성능을 유지할 수 있음을 보여주는 것.
- 도구가 정확히 검색되었을 때조차도 계획 수립 중의 환각 현상을 줄이기 위해 맥락 증강이 어떻게 기여하는지 보여주는 것.
제안 방법
- 도구 검색 이전에 수치적, 범주형, 습관적 사용 패턴 등의 맥락 신호를 검색하고 순위를 매기는 프리리트리ieval 모듈로 컨텍스트 튜닝을 도입한다.
- LambdaMART를 활용한 러닝-투-랭킹과 상호 역수 순위 융합(RRF)을 조합한 경량 검색 모델을 사용하여 다중 검색 신호의 결과를 융합한다.
- 하이브리드 검색 전략을 적용: 의미적 유사도와 사용 패턴 기반으로 맥락 항목을 검색한 후, 학습된 관련성 점수를 바탕으로 재순위를 매긴다.
- 제로샷 CoT 증강과 미세조정된 검색 모델을 모두 적용하여 맥락이 검색 및 계획 성능에 미치는 영향을 평가한다.
- 하위 및 상한 기준을 사용하여 맥락의 영향을 환각과 정확성 측면에서 분리해 내기 위해, 컨텍스트 튜닝 유무에 따라 종합 계획 수립 정확도를 평가한다.
- 실제 RAG 시나리오를 시뮬레이션하면서도 개인정보를 보호하기 위해 합성 사용자 프로필과 성격을 활용한다.

실험 결과
연구 질문
- RQ1컨텍스트 튜닝은 RAG에서 미흡하거나 맥락을 요구하는 질의에 대해 검색 성능을 크게 향상시킬 수 있는가?
- RQ2검색 모델을 미세조정하면 CoT 기반 질의 증강이 더 이상 필요하지 않은가?
- RQ3계획 수립 중 맥락 증강은 환각과 계획 수립 정확도에 어떤 영향을 미치는가?
- RQ4경량 검색 모델이 GPT-4와 같은 대규모 언어모델 기반 검색 시스템보다 맥락 검색에서 뛰어난 성능을 낼 수 있는가?
- RQ5수치적, 범주형, 사용 기반 맥락 신호 중 각각이 검색 효과성에 기여하는 비율은 얼마인가?
주요 결과
- 컨텍스트 튜닝은 표준 의미적 검색 대비 맥락 검색의 Recall@K를 3.5배 향상시켰다.
- 컨텍스트 튜닝을 적용한 도구 검색 Recall@K는 1.5배 향상되어 후속 계획 수립에서의 효과를 입증했다.
- 컨텍스트 튜닝이 적용된 계획 수립기는 AST 기반 계획 정확도 85.24%를 달성하여 표준 RAG 기반 계획 수립기 대비 11.6% 향상되었다.
- 제안된 RRF-LambdaMART 모델은 GPT-4 기반 검색 시스템을 능가하여 최고 성능 설정에서 NDCG@K 98.24%를 기록했다.
- 검색 모델을 미세조정하면 CoT 증강이 필요 없어지며, 미세조정된 모델에 CoT를 추가해도 성능 향상이 미미하다는 점을 확인했다.
- 도구가 정확히 검색되었을 때조차도 계획 수립 중 맥락 증강이 환각을 64% 감소시켰다(하한 기준 대비 2.59에서 0.93으로 감소).

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.