Skip to main content
QUICK REVIEW

[논문 리뷰] MEMORYLLM: Towards Self-Updatable Large Language Models

Yu Wang, Gao, Yifan|arXiv (Cornell University)|2024. 02. 07.
Topic Modeling인용 수 4
한 줄 요약

MemoryLLM는 변환기의 잠재 공간에 통합된 고정 크기의 메모리 풀을 갖춘 자기 업데이트 가능한 대규모 언어 모델을 소개한다. 이는 성능 저하 없이 효율적인 지식 통합과 장기적 유지 보장을 가능하게 한다. 거의 백만 번의 업데이트 이후에도 모델은 功能을 유지하며 모델 편집 및 장문맥 추론 작업에서 베이스라인을 능가한다.

ABSTRACT

Existing Large Language Models (LLMs) usually remain static after deployment, which might make it hard to inject new knowledge into the model. We aim to build models containing a considerable portion of self-updatable parameters, enabling the model to integrate new knowledge effectively and efficiently. To this end, we introduce MEMORYLLM, a model that comprises a transformer and a fixed-size memory pool within the latent space of the transformer. MEMORYLLM can self-update with text knowledge and memorize the knowledge injected earlier. Our evaluations demonstrate the ability of MEMORYLLM to effectively incorporate new knowledge, as evidenced by its performance on model editing benchmarks. Meanwhile, the model exhibits long-term information retention capacity, which is validated through our custom-designed evaluations and long-context benchmarks. MEMORYLLM also shows operational integrity without any sign of performance degradation even after nearly a million memory updates. Our code and model are open-sourced at https://github.com/wangyu-ustc/MemoryLLM.

연구 동기 및 목표

  • 배포 후 새로운 지식을 대규모 언어 모델에 업데이트하는 데 있어 기존 방법이 반복성, 문맥 과부하 또는 성능 저하 문제를 겪는 도전 과제를 해결하기 위해.
  • 백프로파게이션 또는 광범위한 피팅 트레이닝이 필요 없이 새로운 지식을 효율적으로 통합할 수 있는 모델을 설계하기 위해.
  • 과거 지식을 점진적으로 잊는 것을 가능하게 하면서도 모델의 무결성을 유지함으로써 장기적 지식 유지 보장을 보장하기 위해.
  • 거의 백만 번의 업데이트까지도 성능 저하 없이 모델 성능을 유지하고 기능성을 유지하기 위해.
  • 지식 중복을 줄이기 위해 압축 및 효율적으로 저장할 수 있는 고정 크기의 메모리 풀을 사용하여 보다 컴act하게 지식을 저장하기 위해.

제안 방법

  • MemoryLLM는 각 변환기 레이어의 잠재 공간 내에 고정 크기의 메모리 풀을 통합하여, 학습 가능한 메모리 토큰을 사용해 압축된 지식을 표현한다.
  • 모델은 새로운 지식을 모든 레이어로 전파하는 자기 업데이트 메커니즘을 사용하며, 각 단계에서 메모리 토큰의 일부만 업데이트하여 점진적인 잊기 기능을 가능하게 한다.
  • 백프로파게이션 없이 지식 통합을 수행하며, 효율성을 위해 메모리 풀의 직접적 파라미터 업데이트에 의존한다.
  • 메모리 풀은 지식의 저장 및 검색을 위해 훈련되며, 추론 중 모델의 어텐션 메커니즘은 관련 메모리 토큰에 동적으로 주목한다.
  • 기본 LLM 파라미터로 모델링된 지속적 지식과 메모리 풀에 저장된 업데이트 가능한 지식을 아키텍처적으로 분리함으로써 타겟된 업데이트를 가능하게 한다.
  • 모델의 원래 능력이 손상되지 않도록 보장하는 케어드 트레이닝 프로세스를 통해 운영 무결성을 유지한다.
(a) Generation
(a) Generation

실험 결과

연구 질문

  • RQ1백프로파게이션 없이 자기 업데이트 메커니즘을 통해 대규모 언어 모델이 새로운 지식을 효과적으로 통합할 수 있는가?
  • RQ2반복적인 업데이트 이후 기존에 학습한 지식을 얼마나 잘 유지하는가? 그리고 잊기 속도는 어떠한가?
  • RQ3기존 방법과 비교해 메모리 풀이 장문맥 추론 및 모델 편집 작업을 얼마나 잘 지원하는가?
  • RQ4거의 백만 번의 메모리 업데이트와 같은 매우 큰 수의 업데이트 이후에도 모델이 성능과 기능성을 유지하는가?
  • RQ5기존의 검색 기반 또는 장문맥 접근 방식과 비교해 고정 크기의 메모리 풀이 지식을 더 컴팩트하고 중복이 적게 저장할 수 있는가?

주요 결과

  • MemoryLLM는 모델 편집 벤치마크에서 뛰어난 성능을 보였으며, 피팅 트레이닝이나 백프로파게이션 없이도 새로운 사실을 효과적이고 효율적으로 통합함을 입증했다.
  • 장문맥 QA 작업에서 높은 정확도를 유지하여, 광범위한 업데이트 이후에도 강력한 지식 유지 능력을 보였다.
  • 거의 백만 번의 메모리 업데이트 단계 이후 MemoryLLM는 관찰 가능한 성능 저하 없이 기능을 유지함을 확인하여 운영 무결성을 입증했다.
  • 사용자 설계의 유지 평가 및 장문맥 벤치마크를 통해 검증된 바, 지식 유지 보존에서 상당한 향상을 이뤘다.
  • 메모리 풀은 지식의 효과적인 압축을 가능하게 하여, 기존의 검색 기반 또는 장문맥 방법과 비교해 중복을 줄였다.
  • 자기 업데이트 메커니즘은 오래된 지식을 점진적으로 잊는 동시에 이전에 저장된 정보를 유지함으로써 장기적 유용성을 보장했다.
(b) Self-Update
(b) Self-Update

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.