[논문 리뷰] Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
이 논문은 개인정보 보호 프레임워크인 연합 도메인 특화 지식 전이(Federated Domain-Specific Knowledge Transfer, FDKT)를 제안한다. 이 프레임워크는 클라이언트의 비공개 도메인 데이터로부터 미세하게 보호된 합성 데이터를 생성하여, 원시 데이터를 폭 lộ하지 않고도 대규모 언어 모델(LLM)이 소규모 언어 모델(SLM)에게 도메인 특화 지식을 전이할 수 있도록 한다. FDKT는 다양한 도메인에서 SLM의 정확도를 최대 5% 향상시키며, 동시에 10 이하의 개인 정보 보호 예산을 유지한다.
As large language models (LLMs) demonstrate unparalleled performance and generalization ability, LLMs are widely used and integrated into various applications. When it comes to sensitive domains, as commonly described in federated learning scenarios, directly using external LLMs on private data is strictly prohibited by stringent data security and privacy regulations. For local clients, the utilization of LLMs to improve the domain-specific small language models (SLMs), characterized by limited computational resources and domain-specific data, has attracted considerable research attention. By observing that LLMs can empower domain-specific SLMs, existing methods predominantly concentrate on leveraging the public data or LLMs to generate more data to transfer knowledge from LLMs to SLMs. However, due to the discrepancies between LLMs' generated data and clients' domain-specific data, these methods cannot yield substantial improvements in the domain-specific tasks. In this paper, we introduce a Federated Domain-specific Knowledge Transfer (FDKT) framework, which enables domain-specific knowledge transfer from LLMs to SLMs while preserving clients' data privacy. The core insight is to leverage LLMs to augment data based on domain-specific few-shot demonstrations, which are synthesized from private domain data using differential privacy. Such synthetic samples share similar data distribution with clients' private data and allow the server LLM to generate particular knowledge to improve clients' SLMs. The extensive experimental results demonstrate that the proposed FDKT framework consistently and greatly improves SLMs' task performance by around 5\% with a privacy budget of less than 10, compared to local training on private data.
연구 동기 및 목표
- 원시 데이터를 폭 lộ하지 않고도 데이터가 부족하고 개인정보가 민감한 도메인에서 소규모 언어 모델(SLM)의 성능을 향상시키는 데 도전하는 것.
- 기존 지식 전이 기법에서 공개 데이터와 클라이언트의 비공개 도메인 데이터 간의 분포 불일치 문제를 해결하는 것.
- 데이터 프라이버시와 모델 지적 재산권을 유지하면서도 서버 측 LLM에서 클라이언트 측 SLM로 효과적인 지식 전이를 가능하게 하는 것.
- 다양한 모델 아키텍처와 도메인 특화 작업에 적용 가능한 확장성 있고 다용도적인 프레임워크를 개발하는 것.
제안 방법
- 클라이언트는 비공개 도메인 데이터로부터 비밀 보장 기반 생성기를 사용해 차별적 개인 정보 보호를 적용한 합성 데이터를 생성하며, 이는 제한된 개인 정보 보호 예산 내에서 개인정보를 보호한다.
- 합성 데이터는 서버로 전송되며, 여기서 대규모 언어 모델(LLM)이 군집 기반 필터링을 수행하여 차별적 개인 정보 보호에 의해 유도된 아티팩트를 탐지하고 제거한다.
- 정제된 합성 데이터는 서버 측 LLM에서 인코어 기반 학습을 조정하는 데 사용되어 클라이언트의 도메인 분포를 반영하는 타겟된 데이터 증강을 가능하게 한다.
- 증강된 데이터는 클라이언트로 다시 전송되어 현지 SLM의 피니튜닝에 사용되며, 원시 데이터를 폭 lộ하지 않고도 선택적 지식 전이를 실현한다.
- 프레임워크는 서버 LLM에 API 수준의 액세스를 지원하여 클라이언트 데이터와 서버 모델 가중치를 모두 보호한다.
- 이 방법은 모델 아키텍처에 관계없이 적용 가능하여 다양한 LLM과 SLM에 광범위하게 적용 가능하다.
실험 결과
연구 질문
- RQ1차별적 개인 정보 보호를 적용한 합성 데이터가 클라이언트의 개인정보를 보호하면서도 도메인 특화 분포 특성을 유지할 수 있는가?
- RQ2제안된 필터링 기법이 차별적 개인 정보 보호에 의해 발생한 합성 데이터의 아티팩트를 얼마나 효과적으로 완화하는가?
- RQ3서버 측 LLM에서의 지식 전이가 자원이 부족한 도메인 특화 작업에서 클라이언트 측 SLM의 성능을 얼마나 향상시킬 수 있는가?
- RQ4다양한 도메인 특화 작업을 수행하는 다수의 클라이언트가 참여하는 다클라이언트, 다과제 환경에서 FDKT는 어떻게 성능을 발휘하는가?
주요 결과
- FDKT는 Yelp Health, Shopping, AGNews와 같은 다양한 도메인에서 SLM 성능을 약 5% 향상시키며, 비공개 학습 샘플이 200개 밖에 되지 않을 때도 일관되게 성능 향상을 보였다.
- 일대다 시나리오에서 FDKT는 도메인 내 및 도메인 외부 SLM 평가 간 성능 격차를 크게 줄여, 다중 작업 일반화 능력 향상을 입증했다.
- 강력한 개인 정보 보호 보장을 유지하면서도 효과적인 지식 전이가 가능하며, 개인 정보 보호 예산이 10 이하로 유지된다.
- 성능 향상은 서버 측 LLM의 능력과 매우 높은 상관관계를 보이며, 모든 평가 대상 모델(Mistral-7b, Llama2-7b, Llama3-8b, Qwen-14b)에서 더 강력한 LLM일수록 더 좋은 결과를 얻었다.
- 제거 실험 결과, 개인 정보 보호 예산과 증강 샘플 수가 성능에 중대한 영향을 미치며, 중간 설정에서 최적의 성능 향상이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.