[논문 리뷰] RET-LLM: Towards a General Read-Write Memory for Large Language Models
Ret-LLM는 대규모 언어 모델(Large Language Models, LLMs)를 위한 일반적인 읽기-쓰기 메모리 모듈을 도입하여, Davidsonian 의미론에 영감을 받은 삼중항 기반 표현(예: <주어, 관계, 목적어>)을 통해 명시적인 지식 저장 및 검색을 가능하게 한다. 이 프레임워크는 미세조정된 LLM을 컨트롤러로 사용하여 메모리 API 호출을 생성하며, 다양한 소스—데이터베이스 포함—에서 유연하고 확장 가능하며 해석 가능한 지식 저장 및 업데이트를 지원한다. 특히 시간적 및 집계 작업에서 뛰어난 성능을 보이며, 모든 필요한 정보가 컨텍스트에 존재하는 경우조차도 제로샷 LLM보다 뛰어난 성능을 발휘한다.
Large language models (LLMs) have significantly advanced the field of natural language processing (NLP) through their extensive parameters and comprehensive data utilization. However, existing LLMs lack a dedicated memory unit, limiting their ability to explicitly store and retrieve knowledge for various tasks. In this paper, we propose RET-LLM a novel framework that equips LLMs with a general write-read memory unit, allowing them to extract, store, and recall knowledge from the text as needed for task performance. Inspired by Davidsonian semantics theory, we extract and save knowledge in the form of triplets. The memory unit is designed to be scalable, aggregatable, updatable, and interpretable. Through qualitative evaluations, we demonstrate the superiority of our proposed framework over baseline approaches in question answering tasks. Moreover, our framework exhibits robust performance in handling temporal-based question answering tasks, showcasing its ability to effectively manage time-dependent information.
연구 동기 및 목표
- 현재 파라미터에 암시적으로 저장되는 지식 외에 명시적이고 지속적인 메모리가 부족한 대규모 언어 모델(LLMs)의 문제를 해결하기 위해.
- 텍스트, SQL, NoSQL, 스프레드시트 등 다양한 소스에서 지식을 명시적으로 저장, 검색, 업데이트할 수 있도록 하기 위해.
- 확장 가능하고 해석 가능하며 집계 가능한 메모리 연산을 지원하여, 여러 문서에 산재한 사실들을 조합할 수 있도록 하기 위해.
- 시간적 맥락이나 다중 문서 집계를 포함한 복잡한 질문-응답 작업에서 성능을 향상시키기 위해.
- 메모리 연산을 LLM에서 분리하여 유지보수성과 해석 가능성 향상을 위한 모듈러하고 컨트롤러 기반 아키텍처를 제공하기 위해.
제안 방법
- 프레임워크는 언어 모델(Alpaca-7B), 컨트롤러, 메모리 유닛을 통합하며, 컨트롤러가 사용자 입력, LLM, 메모리 간의 상호작용을 조율한다.
- 지식은 Davidsonian 의미론에 영감을 받은 미세조정된 LLM을 사용해 텍스트에서 삼중항 <개념1, 관계, 개념2> 형태로 추출된다.
- 메모리 유닛은 삼중항과 그 벡터 임베딩을 저장하며, 임베딩의 LSH 기반 해싱을 통해 정확한 매칭 및 흐린 검색을 가능하게 한다.
- LLM이 입력 컨텍스트에 기반해 API 호출을 생성함으로써, 쓰기(저장) 및 읽기(검색) 작업을 처리하는 메모리 API가 생성된다.
- LoRA를 사용한 지시 미세조정을 통해 파rameter 효율성을 확보하며, 손실는 입력 시퀀스의 API 생성 부분에만 적용된다.
- 시스템은 동적 업데이트 및 관련 사실의 집계를 지원하여, 여러 문서에서 한 국가의 모든 도시를 나열하는 등의 작업을 가능하게 한다.
실험 결과
연구 질문
- RQ1일반적인 읽기-쓰기 메모리 모듈을 LLM에 효과적으로 통합하여 명시적 지식 저장 및 검색이 가능한가?
- RQ2삼중항 기반 메모리 표현 방식은 여러 문서 및 데이터 소스 간에 해석 가능하고 집계 가능한 지식 관리에 어떻게 기여하는가?
- RQ3제안된 프레임워크는 필요한 정보가 컨텍스트에 존재하지만 제로샷 모델이 이를 제대로 활용하지 못하는 질문-응답 작업에서 LLM의 성능을 향상시킬 수 있는가?
- RQ4재학습 없이도 정치 지도자 변경과 같은 시간적 지식 업데이트를 어떻게 처리하는가?
- RQ5메모리 모듈은 SQL 및 NoSQL 데이터베이스와 같은 비텍스트 데이터 소스를 얼마나 잘 지원할 수 있는가?
주요 결과
- Ret-LLM 프레임워크는 필요한 정보가 이미 입력 컨텍스트에 존재하는 경우조차도 LLM이 명시적으로 지식을 저장하고 검색할 수 있도록 성공적으로 구현하였다. 제로샷 설정에서 관찰된 실패를 수정하였다.
- 제로샷 평가에서 기반 Alpaca-7B 모델은 컨텍스트에 모든 필수 정보가 존재했음에도 불구하고 질문에 정확히 답하지 못했지만, Ret-LLM은 메모리에서 저장된 삼중항을 정확히 검색하고 활용하였다.
- 시간적 질문-응답 작업, 예를 들어 현재 미국 대통령을 식별하는 데서도 프레임워크는 모델 재학습 없이도 메모리 업데이트를 허용함으로써 뛰어난 성능을 보였다.
- 삼중항 기반 저장 방식 덕분에 산재한 사실들을 효과적으로 집계할 수 있었으며, 예를 들어 여러 문서에서 도시 목록을 컴iles하는 데 성공하였다.
- LLM이 생성한 메모리 API 호출을 기반으로 한 컨트롤러 아키텍처는 LLM과 메모리 유닛 간의 원활하고 해석 가능하며 모듈러한 상호작용을 가능하게 하였다.
- LoRA를 사용한 구현은 단일 A6000 GPU에서 효율적인 미세조정을 가능하게 하여 자원 제약 환경에서도 실행 가능성과 타당성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.