[논문 리뷰] CBR-RAG: Case-Based Reasoning for Retrieval Augmented Generation in LLMs for Legal Question Answering
이 논문은 사실적 정확성과 맥락 관련성을 향상시키기 위해 LLM 기반의 법적 질문 응답에 사례 기반 추론(CBR)을 통합한 검색 보강 생성 프레임워크인 CBR-RAG를 제안한다. CBR의 색인, 유사도 매칭, 사례 재사용 메커니즘을 활용해 의미적으로 유사한 과거 사례를 LLM 프롬프트에 통합함으로써, 기준 모델 대비 평균 1.94% 향상된 답변 유사도를 달성하였으며, k=3일 때 하이브리드 AnglEBERT가 가장 우수한 성능을 보였다.
Retrieval-Augmented Generation (RAG) enhances Large Language Model (LLM) output by providing prior knowledge as context to input. This is beneficial for knowledge-intensive and expert reliant tasks, including legal question-answering, which require evidence to validate generated text outputs. We highlight that Case-Based Reasoning (CBR) presents key opportunities to structure retrieval as part of the RAG process in an LLM. We introduce CBR-RAG, where CBR cycle's initial retrieval stage, its indexing vocabulary, and similarity knowledge containers are used to enhance LLM queries with contextually relevant cases. This integration augments the original LLM query, providing a richer prompt. We present an evaluation of CBR-RAG, and examine different representations (i.e. general and domain-specific embeddings) and methods of comparison (i.e. inter, intra and hybrid similarity) on the task of legal question-answering. Our results indicate that the context provided by CBR's case reuse enforces similarity between relevant components of the questions and the evidence base leading to significant improvements in the quality of generated answers.
연구 동기 및 목표
- LLM이 생성한 법적 답변의 사실 기반 부족과 근거 불명 문제를 해결하기 위해, 구조화된 사례 기반 추론을 검색 보강 생성에 통합한다.
- 일반 및 도메인 특화 임bedding 표현 방식과 유사도 비교 전략(상호, 내부, 하이브리드)이 법적 QA에서 검색 품질에 미치는 영향을 평가한다.
- 의미적으로 유사한 법적 사례에서 유래한 더 풍부하고 맥락적으로 관련성이 높은 프롬프트를 제공함으로써 CBR-RAG가 LLM 출력을 향상시킨다는 것을 입증한다.
- 답변의 정확성과 환각 현상을 줄이기 위해 법적 RAG 시스템에서 임베딩 모델 및 검색 파라미터의 최적 설정을 규명한다.
제안 방법
- CBR-RAG는 RAG 파이프라인에 CBR 사이클의 검색, 색인, 유사도 매칭 단계를 통합하여 법적 사례의 검색을 체계화하고 풍부하게 한다.
- 질문과 사례를 유사도 계산을 위해 BERT, LegalBERT, AnglEBERT의 임베딩 기반 사례 표현을 사용한다.
- 세 가지 유사도 전략을 평가한다: 질문과 사례 간의 상호 유사도, 질문 또는 사례 구성 요소 내부의 내부 유사도, 그리고 둘을 조합한 하이브리드 유사도.
- 검색에 k-최근접 이웃(k-NN)을 사용하며, k ∈ {1, 3, 5, ..., 37}로 설정하고, F1 점수 평가 기반으로 k=3을 최적 값으로 선정한다.
- 생성된 답변은 Mistral-7B 모델을 생성기로 사용하여 LLM 출력과 기준 답변 간의 코사인 유사도로 평가된다.
- 하이브리드 임베딩은 여러 임베딩 유형(예: BERT + LegalBERT + AnglEBERT)을 학습된 가중치로 조합하여 세분화된 유사도 매칭을 향상시킨다.

실험 결과
연구 질문
- RQ1RAG의 검색 단계에 사례 기반 추론(CBR)을 통합할 경우, 법적 질문-응답에서 LLM이 생성한 답변의 품질은 어떻게 향상되는가?
- RQ2일반 모델 대비 도메인 특화 모델의 임베딩 모델이 법적 RAG 시스템의 검색 성능에 미치는 영향은 어떠한가?
- RQ3상호, 내부, 하이브리드 중 어떤 유사도 비교 전략이 법적 QA 작업에서 가장 효과적인 사례 검색을 이끌는가?
- RQ4검색된 사례 수(k)가 생성된 답변의 사실적 정확성과 의미적 품질에 어떤 영향을 미치는가?
- RQ5다양한 모델을 조합한 하이브리드 임베딩이 개별 임베딩보다 법적 LLM의 사례 검색 및 답변 생성에서 더 뛰어난 성능을 보일 수 있는가?
주요 결과
- 하이브리드 AnglEBERT 모델이 [0.25, 0.40, 0.35] 가중치와 함께 k=3일 때 검색에서 가장 높은 F1 점수를 기록하여 최적 설정으로 확인되었다.
- k=3 및 프롬프트에 전체 사례 내용을 포함한 CBR-RAG는 k=1 및 기준 No-RAG보다 우수했으며, 기준 답변과의 코사인 유사도에서 평균 1.94% 향상된 성과를 보였다.
- k=3에서 하이브리드 AnglEBERT는 No-RAG 기준 및 하이브리드 LegalBERT(k=3)보다 유의미하게 뛰어났으며, p < 0.05(일측 t-검정)로 통계적 유의성을 입증했다.
- 프롬프트에 전체 사례를 포함한 경우, 대부분의 하이브리드 임베딩 변형에서 지원 텍스트만 사용한 경우보다 성능 향상이 뚜렷했다.
- AnglEBERT의 대비 학습 기반 사전 훈련 방식은 ALQA 코퍼스에 대한 미세조정 없이도 BERT 및 LegalBERT보다 뛰어난 성능을 보였다.
- 결과적으로, 특히 자원이 제한된 법적 도메인에서 대비 학습 기반 임베딩이 표준 자기지도 마스킹보다 더 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.