[논문 리뷰] Massive Editing for Large Language Models via Meta Learning
이 논문은 BERT, GPT-2, T5-XL, GPT-J와 같은 다양한 대규모 언어모델(LM)에서 수천 개의 사실을 동시에 효율적이고 메모리 효율적으로 편집할 수 있도록 하는 메타러닝 기반 방법인 MALMEN을 제안한다. 파라미터 이동 집합을 최소 제곱 문제로 공식화하고, 정규 방정식을 통해 이를 해결함으로써, 기존의 MEND 및 MEMIT와 같은 방법보다 확장성과 정확도에서 뛰어난 성능을 발휘한다.
While large language models (LLMs) have enabled learning knowledge from the pre-training corpora, the acquired knowledge may be fundamentally incorrect or outdated over time, which necessitates rectifying the knowledge of the language model (LM) after the training. A promising approach involves employing a hyper-network to generate parameter shift, whereas existing hyper-networks suffer from inferior scalability in synchronous editing operation amount. To mitigate the problem, we propose the MAssive Language Model Editing Network (MALMEN), which formulates the parameter shift aggregation as the least square problem, subsequently updating the LM parameters using the normal equation. To accommodate editing multiple facts simultaneously with limited memory budgets, we separate the computation on the hyper-network and LM, enabling arbitrary batch size on both neural networks. Our method is evaluated by editing up to thousands of facts on LMs with different architectures, i.e., BERT-base, GPT-2, T5-XL (2.8B), and GPT-J (6B), across various knowledge-intensive NLP tasks, i.e., closed book fact-checking and question answering. Remarkably, MALMEN is capable of editing hundreds of times more facts than strong baselines with the identical hyper-network architecture and outperforms editor specifically designed for GPT. Our code is available at https://github.com/ChenmienTan/malmen.
연구 동기 및 목표
- 다수의 사실을 동시에 편집할 때 기존의 하이퍼넷워크 기반 언어모델 편집 방법의 확장성 한계를 해결하기 위해.
- MEND와 같은 이전 방법에서 발생하는 기울기 누적의 취소 효과와 통계적 비효율성을 극복하기 위해.
- 하이퍼넷워크와 언어모델의 계산을 분리함으로써 학습 중 메모리 소비를 줄이고, 임의의 배치 크기를 허용하기 위해.
- 다양한 언어모델과 지식 집약적인 자연어처리 작업에서 높은 편집 성능와 일반화 능력을 달성하기 위해.
- catastrophic forgetting 없이 재학습 없이 실용적이고 산업 수준의 언어모델 편집을 가능하게 하기 위해.
제안 방법
- MALMEN은 다수의 사실에 대한 파라미터 이동 집합을 잔차 오차를 최소화하고 취소 효과를 줄이기 위해 최소 제곱 최적화 문제로 공식화한다.
- 최소 제곱 문제를 정규 방정식을 사용하여 해결함으로써, 모든 주입된 사실에 대해 효과적인 전역 최적의 파라미터 이동을 확보한다.
- 하이퍼넷워크와 언어모델 간의 계산을 분리함으로써 각각 독립적이고 임의의 배치 크기를 허용하며, 메모리 사용을 크게 줄인다.
- 하이퍼넷워크는 표준 미세조정 기울기를 조건으로 하여 파라미터 이동을 예측하도록 훈련되어 모델 일관성과 국소성을 유지한다.
- 정규화를 최소 제곱 목표 함수에 적용하여 일반화와 안정성을 향상시키며, 특히 핵심 행렬의 질서가 낮을 경우에 유의미하다.
- 특정 토큰의 답변을 생성하는 데 기여하는 키 및 밸류 기울기만 캐시함으로써, 단일 A40 GPU에서 학습 및 추론 속도를 38.9% 향상시킨다.
실험 결과
연구 질문
- RQ1대규모 편집을 위한 파라미터 이동 집합을 최소 제곱 문제로 공식화할 수 있는가? 이는 취소 효과를 줄이고 통계적 유의성을 향상시킬 수 있는가?
- RQ2하이퍼넷워크와 언어모델의 계산을 분리하면 임의의 배치 크기를 허용하고 학습 중 메모리 소비를 크게 줄일 수 있는가?
- RQ3MALMEN은 다양한 언어모델과 작업에서 수천 개의 사실을 동시에 높은 정확도와 일반화 능력으로 편집할 수 있는가?
- RQ4폐쇄책 사실 검증 및 질의 응답 작업에서 MALMEN은 MEND 및 MEMIT보다 확장성과 성능 면에서 어떻게 비교되는가?
- RQ5MALMEN은 재구성된 프롬프트 간 일관성을 유지하는가, 아니면 훈련 프롬프트 형식을 초월한 일반화에 한계가 있는가?
주요 결과
- MALMEN는 동일한 하이퍼넷워크 아키텍처를 사용함에도 불구하고 MEND보다 최대 1,000배 더 많은 사실을 편집함으로써 뛰어난 확장성을 입증한다.
- GPT-J (6B)에서 MALMEN는 1,000개의 사실 편집 작업에서 정확히 일치하는 정답률(ES) 99.7%와 생성 점수(GS) 92.8%를 달성하여 MEND 및 MEMIT를 뛰어넘는다.
- MALMEN는 MEND의 기울기 누적 방법 대비 평균 잔차(MR)를 세 자리 수준으로 감소시켜 상당히 줄어든 취소 효과를 나타낸다.
- MALMEN의 메모리 소비는 편집 수와 함께 느리게 증가하여, 단일 A40 GPU에서 수천 개의 사실을 편집할 수 있지만, MEND 방식의 연결 방식은 빠르게 하드웨어 한계에 도달한다.
- 답변에 관련된 토큰의 기울기만 캐시함으로써 성능 손실 없이 학습 및 추론 시간을 38.9% 단축시킨다.
- 제거 실험 결과, 정규 방정식과 정규화가 수렴성과 성능에 핵심적임을 확인하였으며, 특히 행렬이 특이성이 있는 BERT-base와 같은 모델에서 중요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.