[論文レビュー] Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
本稿では、プライバシーを守るフレームワークとして、フェデレーテッドドメイン固有の知識移行(FDKT)を提案する。この手法は、クライアントのプライベートドメインデータから微分プライバシーを適用した合成データを生成し、そのデータを用いて大規模言語モデル(LLM)が小規模言語モデル(SLM)にドメイン固有の知識を移行可能にする。FDKTは、10未満のプライバシー予算を維持しながら、多様なドメインでSLMの精度を最大5%向上させる。
As large language models (LLMs) demonstrate unparalleled performance and generalization ability, LLMs are widely used and integrated into various applications. When it comes to sensitive domains, as commonly described in federated learning scenarios, directly using external LLMs on private data is strictly prohibited by stringent data security and privacy regulations. For local clients, the utilization of LLMs to improve the domain-specific small language models (SLMs), characterized by limited computational resources and domain-specific data, has attracted considerable research attention. By observing that LLMs can empower domain-specific SLMs, existing methods predominantly concentrate on leveraging the public data or LLMs to generate more data to transfer knowledge from LLMs to SLMs. However, due to the discrepancies between LLMs' generated data and clients' domain-specific data, these methods cannot yield substantial improvements in the domain-specific tasks. In this paper, we introduce a Federated Domain-specific Knowledge Transfer (FDKT) framework, which enables domain-specific knowledge transfer from LLMs to SLMs while preserving clients' data privacy. The core insight is to leverage LLMs to augment data based on domain-specific few-shot demonstrations, which are synthesized from private domain data using differential privacy. Such synthetic samples share similar data distribution with clients' private data and allow the server LLM to generate particular knowledge to improve clients' SLMs. The extensive experimental results demonstrate that the proposed FDKT framework consistently and greatly improves SLMs' task performance by around 5\% with a privacy budget of less than 10, compared to local training on private data.
研究の動機と目的
- データが乏しく、プライバシーが求められるドメインにおける小規模言語モデル(SLM)の性能向上を、プライベートデータを露呈せずに実現すること。
- 従来の知識蒸留手法における、公開データとクライアントのプライベートドメインデータとの分布の不一致を解消すること。
- サーバー側のLLMからクライアント側のSLMへの有効な知識移行を実現しつつ、データプライバシーとモデルの知的財産権を保護すること。
- 多様なモデルアーキテクチャーやドメイン固有のタスクに適用可能なスケーラブルで汎用性の高いフレームワークの開発。
提案手法
- クライアントは、プライベートドメインデータから、境界付きのプライバシー予算のもとで微分プライバシーを適用した合成データを生成するプライベートジェネレータを用いて生成する。
- 生成された合成データはサーバーに送信され、大規模言語モデル(LLM)がクラスタリングベースのフィルタリングを実行し、微分プライバシーによって生じたアーティファクトを検出し、削除する。
- クリーニングされた合成データを用いて、サーバー側のLLMでインライン学習を条件づけることで、クライアントのドメイン分布を反映したターゲット特化のデータ拡張を実現する。
- 拡張されたデータはクライアントに送り返され、ローカルSLMのファインチューニングに使用され、生データを露呈せずに選択的知識移行を実現する。
- フレームワークはサーバーLLMへのAPIレベルのアクセスをサポートしており、クライアントデータとサーバーのモデル重みの両方を保護する。
- この手法はモデルアーキテクチャに依存せず、さまざまなLLMとSLMに広く適用可能である。
実験結果
リサーチクエスチョン
- RQ1微分プライバシーを適用した条件下で生成された合成データが、ドメイン固有の分布的特徴を保持しつつ、クライントのデータプライバシーを確保できるか。
- RQ2提案されたフィルタリング機構は、微分プライバシーによって生じた合成データ内のアーティファクトをどれほど効果的に低減できるか。
- RQ3サーバー側のLLMから知識移行を行うことで、リソースが乏しくドメイン固有のタスクにおいて、クライアント側のSLMの性能がどの程度向上するか。
- RQ4複数のクライアントが多様なドメイン固有のタスクを有するマルチクライアント・マルチタスク環境において、FDKTはどの程度の性能を示すか。
主な発見
- FDKTは、Yelp Health、Shopping、AGNewsを含む複数のドメインで、たとえ200件のプライベートトレーニングサンプルしか利用しなくても、SLMの性能を約5%一貫して向上させる。
- ワン・トゥ・マニのシナリオでは、ドメイン内とドメイン外のSLM評価間の性能ギャップが顕著に縮小され、マルチタスク一般化性能の向上が示された。
- フレームワークは、10未満のプライバシー予算を維持しながらも、強力なプライバシー保証を実現している。
- 性能向上は、サーバー側LLMの能力に強く相関しており、Mistral-7b、Llama2-7b、Llama3-8b、Qwen-14bを含むすべての評価対象モデルで、より強力なLLMがより良い結果をもたらす。
- アブレーションスタディの結果、プライバシー予算と拡張サンプル数の両方が性能に顕著な影響を及ぼすことが確認され、最適な向上が中程度の設定で得られている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。