[論文レビュー] Cross-Lingual Knowledge Editing in Large Language Models
本稿は、多言語大規模言語モデル(LLMs)における多言語知識編集を調査し、英語の知識編集例を中国語に翻訳することで二言語のZsREベースのデータセット(Bi-ZsRE)を提案する。LLaMA、LLaMA2、Baichuanモデルを対象に複数の編集手法を評価した結果、ある言語での知識編集が他の言語にうまく伝わらないことが判明し、多言語間の一般化性と局所性に顕著な性能低下が生じ、多言語モデルにおける一貫性ある振る舞いの維持に大きな課題があることが示された。
Knowledge editing aims to change language models' performance on several special cases (i.e., editing scope) by infusing the corresponding expected knowledge into them. With the recent advancements in large language models (LLMs), knowledge editing has been shown as a promising technique to adapt LLMs to new knowledge without retraining from scratch. However, most of the previous studies neglect the multi-lingual nature of some main-stream LLMs (e.g., LLaMA, ChatGPT and GPT-4), and typically focus on monolingual scenarios, where LLMs are edited and evaluated in the same language. As a result, it is still unknown the effect of source language editing on a different target language. In this paper, we aim to figure out this cross-lingual effect in knowledge editing. Specifically, we first collect a large-scale cross-lingual synthetic dataset by translating ZsRE from English to Chinese. Then, we conduct English editing on various knowledge editing methods covering different paradigms, and evaluate their performance in Chinese, and vice versa. To give deeper analyses of the cross-lingual effect, the evaluation includes four aspects, i.e., reliability, generality, locality and portability. Furthermore, we analyze the inconsistent behaviors of the edited models and discuss their specific challenges. Data and codes are available at https://github.com/krystalan/Bi_ZsRE
研究の動機と目的
- 多言語LLMにおける知識編集の多言語的影響を調査すること。編集は1つの言語で実施され、別の言語で評価される。
- LLaMA、LLaMA2、Baichuanなどの多言語LLMにおいて、既存の知識編集手法が編集知識を言語間で効果的に伝達できるかどうかを検討すること。
- 編集モデルの信頼性、一般化性、局所性、移植性を、異なる言語間で分析し、多言語的振る舞いにおける不一致や課題を同定すること。
- 元のZsREデータセットを英語から中国語に翻訳することで、大規模な二言語知識編集データセット(Bi-ZsRE)を構築すること。
提案手法
- 著者らは、最先端のLLM(例:ChatGPT や GPT-4)を用いてZsREデータセットを自動的に英語から中国語に翻訳し、二言語データセットとしてBi-ZsREを構築した。
- 7つの知識編集手法(メモリベースの(SERAC、MEMIT)、メタラーニング(MEND、IKE)、局所化後に編集する(ROME、KN、FT))を、多言語LLMで評価した。
- 評価は4つの次元に焦点を当てた:信頼性(正しさ)、一般化性(言い換えられたプロンプトでの性能)、局所性(スコープ外の事実の保持)、移植性(推論ベースの質問への一般化)。
- 多言語間伝達を評価するため、モデルは英語で編集し中国語で評価し、逆も同様に実施した。言語不一致の影響を考慮し、厳密な評価設定と緩い評価設定の両方を用いた。
- 緩い評価設定では、ターゲット言語のクエリに対して、元の言語とターゲット言語の両方の正解を許容することで、言語不一致の影響を軽減した。
- 中国語-LLaMA-2-7Bおよび他の多言語LLMを用いて実験を行い、編集言語と評価言語の両方でF1スコアとEMスコアを含む定量的指標を用いた。
実験結果
リサーチクエスチョン
- RQ11つの言語(例:英語)で実施した知識編集が、他の言語(例:中国語)に成功裏に伝わるか?
- RQ2信頼性、一般化性、局所性、移植性という観点から、知識編集手法の性能が言語間でどのように変化するか?
- RQ31つの言語で編集を実施すると、他の言語におけるモデルの振るまいにどのような影響が生じるか、特に局所性と意図しない知識変更の観点から。
- RQ4言語間の言語モデリング能力の格差が、知識編集の効率性と有効性にどのように影響するか?
- RQ5知識伝達と言語不一致の観点から、多言語知識編集における具体的な課題や一貫性のない振るまいは何か?
主な発見
- 1つの言語での知識編集は他の言語への伝達が著しく不十分である:SERAC(En)は英語一般化性で83.64 F1を達成したが、中国語では28.46 F1に低下した。一方、SERAC(Zh)は中国語で67.93 F1を達成したが、英語では15.00 F1にとどまった。
- 編集手法の多言語間一般化性は顕著に制限されている。大多数の手法が、非編集言語で評価された際、50%以上の性能低下を示した。
- 1つの言語での編集が他の言語の局所性に影響を与える。例:MEND(En)は英語局所性で90.50 F1、中国語で89.75 F1を達成し、多言語的干渉が生じていることが示された。
- 移植性性能は言語間で極めて低く、多くの手法が表面的な語順の記憶にとどまり、意味的知識の内省的統合に失敗している。
- 言語不一致は評価に顕著な影響を与える。正解基準を元言語とターゲット言語の両方を許容する緩い評価設定を採用することで、一般化スコアがわずかに向上した。これは、言語不一致が実際の要因ではあるが、相対的に小さい要因であることを確認した。
- IKEは高い信頼性を示すが、局所性が低い(例:中国語局所性で89.74 F1)。これは、特に局所性が低い手法では、意図しない知識変更のリスクがあることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。