[論文レビュー] Federated Neuro-Symbolic Learning
FedLogicは、非独立同分布(non-i.i.d.)クライアントにおける大規模言語モデル(LLMs)のマルチドメインチェーン・オブ・トゥーク(CoT)プロンプト選択のための、新規で解釈可能なフェデレーテッド神経記号的フレームワークを提案する。変分期待値最大化(V-EM)とKLダイバージェンス制約を用いた二段階最適化により、パーソナライゼーションと一般化のバランスを図る。確率的潜在変数推論としてのルール生成をモデル化することで、クロスドメインCoT推論において優れた性能を達成する。
Neuro-symbolic learning (NSL) models complex symbolic rule patterns into latent variable distributions by neural networks, which reduces rule search space and generates unseen rules to improve downstream task performance. Centralized NSL learning involves directly acquiring data from downstream tasks, which is not feasible for federated learning (FL). To address this limitation, we shift the focus from such a one-to-one interactive neuro-symbolic paradigm to one-to-many Federated Neuro-Symbolic Learning framework (FedNSL) with latent variables as the FL communication medium. Built on the basis of our novel reformulation of the NSL theory, FedNSL is capable of identifying and addressing rule distribution heterogeneity through a simple and effective Kullback-Leibler (KL) divergence constraint on rule distribution applicable under the FL setting. It further theoretically adjusts variational expectation maximization (V-EM) to reduce the rule search space across domains. This is the first incorporation of distribution-coupled bilevel optimization into FL. Extensive experiments based on both synthetic and real-world data demonstrate significant advantages of FedNSL compared to five state-of-the-art methods. It outperforms the best baseline by 17% and 29% in terms of unbalanced average training accuracy and unseen average testing accuracy, respectively.
研究の動機と目的
- フェデレーテッドLLMsにおけるマルチドメインチェーン・オブ・トゥーク(CoT)プロンプト選択のための原理的で解釈可能な手法の不足に対処する。
- プロンプト工学の試行錯誤的性質を克服し、CoT選択を二段階最適化問題として形式化する。
- クライアントが多様で機微なデータを保有する非i.i.d.フェデレーテッドラーニング環境において、一般化とパーソナライゼーションのバランスを取る。
- 数学的問題解決のCoT能力を、物語作成タスクへとクロスドメインで転送可能にする。
- 変換器ベースの潜在分散論理ルール学習者を導入し、確率的モデリングによりプロンプト選択とルール生成を統合的に最適化する。
提案手法
- 上位モデル(FedLogic)がプロンプトを選択し、下位モデルがCoT推論ステップを生成する二段階プログラムとしてCoTプロンプト選択を形式化する。
- 変分期待値最大化(V-EM)を用いて、潜在的CoTルールの事後分布を近似し、エンド・ツー・エンドの学習を可能にする。
- 2つのKLダイバージェンス制約を統合する:1つはクライアント固有の事後分布とグローバル事前分布の間、もう1つはクロスドメインパーソナライゼーションのための潜在空間の正則化。
- サーバーのルール意思決定を確率的隠れ変数としてモデル化し、非i.i.d. FL環境における動的重み付けと適応性の向上を可能にする。
- クライアントのクエリとグローバル知識を条件としてCoTルールを生成する、変換器ベースのアーキテクチャを潜在分散論理ルール学習者として使用する。
- フェデレーテッドラーニングの目的関数を再定式化し、クライアント間の一対多関係をサポートする。これは、従来の1対1ニューラル記号的システムとは区別される。
実験結果
リサーチクエスチョン
- RQ1どのようにして、フェデレーテッドLLMsにおけるマルチドメインCoTプロンプト選択のための原理的で解釈可能なフレームワークを設計できるか?
- RQ2LLMsは、フェデレーテッド環境下で、数学的問題解決のCoT能力を物語作成タスクへどの程度効果的に転送できるか?
- RQ3非i.i.d.クライアント間で、一般化とパーソナライゼーションを効果的にバランスさせるにはどうすればよいか?
- RQ4V-EMフレームワークにおけるKLダイバージェンス制約は、大きな探索空間の課題を軽減し、クロスドメインCoTパフォーマンスを向上させるか?
- RQ5FedLogicは、既存のベースラインと比較して、1対多、非i.i.d.フェデレーテッドCoT選択シナリオでどのように優れているか?
主な発見
- FedLogicは、V-EMを用いた二段階最適化問題としてプロセスを形式化する、最初の解釈可能で原理的なフェデレーテッドマルチドメインCoTプロンプト選択フレームワークである。
- 2つのKLダイバージェンス制約の統合により、大規模な探索空間の管理とクロスドメインパーソナライゼーションの両方が可能になり、性能が顕著に向上した。
- 最適化済みの最先端ベースラインですらFedLogicに劣る結果を示し、マルチドメインCoTタスクにおける優れた一般化性能と適応性を示した。
- 数学的推論のCoTパターンが、物語作成タスクへ効果的に転送された。これは、効果的なクロスドメイン知識転送を示している。
- サーバーのルール意思決定を確率的隠れ変数としてモデル化することで、FedLogicは動的重み付けを可能にし、非i.i.i.d.クライアントデータ分布のより良い処理が可能になった。
- 従来の1対1ニューラル記号的システムとは対照的に、FedLogicの1対多アーキテクチャは、現実のフェデレーテッドラーニングシナリオの複雑さをよりよく捉えている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。