Skip to main content
QUICK REVIEW

[論文レビュー] Decoding Secret Memorization in Code LLMs Through Token-Level Characterization

Yuqing Nie, Chong Wang|arXiv (Cornell University)|Oct 11, 2024
Advanced Malware Detection Techniques被引用数 4
ひとこと要約

本稿では、コード言語モデルにおける本物のシークレットと幻覚的なシークレットを区別するために、トークンレベルの確率分析を用いる二段階手法DeSecを提案する。本物のシークレットトークンの4つの特徴—高い安定した確率、より高い全体的な確率、より強い確率優位性、およびシャノンエントロピーを用いた早期検出可能性—を特定することで、生成をガイドし、プロンプトベースのベースラインと比較して、より高い妥当性で本物のシークレットをより多く抽出する。

ABSTRACT

Code Large Language Models (LLMs) have demonstrated remarkable capabilities in generating, understanding, and manipulating programming code. However, their training process inadvertently leads to the memorization of sensitive information, posing severe privacy risks. Existing studies on memorization in LLMs primarily rely on prompt engineering techniques, which suffer from limitations such as widespread hallucination and inefficient extraction of the target sensitive information. In this paper, we present a novel approach to characterize real and fake secrets generated by Code LLMs based on token probabilities. We identify four key characteristics that differentiate genuine secrets from hallucinated ones, providing insights into distinguishing real and fake secrets. To overcome the limitations of existing works, we propose DESEC, a two-stage method that leverages token-level features derived from the identified characteristics to guide the token decoding process. DESEC consists of constructing an offline token scoring model using a proxy Code LLM and employing the scoring model to guide the decoding process by reassigning token likelihoods. Through extensive experiments on four state-of-the-art Code LLMs using a diverse dataset, we demonstrate the superior performance of DESEC in achieving a higher plausible rate and extracting more real secrets compared to existing baselines. Our findings highlight the effectiveness of our token-level approach in enabling an extensive assessment of the privacy leakage risks associated with Code LLMs.

研究の動機と目的

  • コード言語モデルにおける記憶済みシークレットを検出するプロンプト工学の限界、特に高い幻覚発生率と非効率な抽出の問題を解決すること。
  • コード生成における本物のシークレットと幻覚的なものとを区別するための、内因的なトークンレベルの特徴を同定すること。
  • これらの特徴を活用して生成をガイドする手法を開発し、シークレット抽出の正確性と多様性を向上させること。
  • コード言語モデルにおけるプライバシー漏洩リスクのより包括的かつ信頼性の高い評価を可能にすること。

提案手法

  • 本物のシークレットトークンの4つの特徴を同定する:(C1) 高い確率での安定化、(C2) より高い全体的確率、(C3) より強い確率優位性、(C4) シャノンエントロピーを用いた早期検出可能性。
  • プロキシコード言語モデルを用いてトレーニングデータを生成し、本物のシークレットに属する可能性を予測するモデルを訓練することで、オフラインのトークンスコアリングモデルを構築する。
  • オンライン生成中にスコアリングモデルを適用し、元の言語モデルの確率と組み合わせてトークンの尤度を再割り当てすることで、本物のシークレットトークンに向けた生成をガイドする。
  • HCRやBS-5などのベースライン手法で生成終了を引き起こす無効なトークン(例:'&')を抑制するためのマスキング強化を実装する。
  • スコアリングモデルによる確率再重み付けを用いて、生成中に本物のシークレットトークンの選択確率を高める。
  • 1200件のコードファイルを含む多様なデータセットを用い、5つの最先端のコード言語モデルで本手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1コード言語モデルにおける本物のシークレットと幻覚的なものとを区別するトークンレベルの特徴は何か?
  • RQ2プロキシ言語モデルでトレーニングされたトークンレベルスコアリングモデルは、本物のシークレット抽出を効果的にガイドできるか?
  • RQ3DeSecは、妥当率と本物のシークレット抽出の観点で、従来のプロンプトベースのベースラインと比較してどのように異なるか?
  • RQ4トークンスコアリングモデルは、異なるコード言語モデルアーキテクチャに一般化可能か?

主な発見

  • DeSecは5つのコード言語モデル全体で平均44.74%の妥当率(PR)を達成し、HCR(10.98%)やBS-5(23.60%)を顕著に上回った。
  • DeSecは被害モデルから1076個の本物のシークレットを効果的に抽出した。これはHCRの230個、BS-5の845個を上回った。
  • StarCoder2-15Bでは、トークンスコアリングモデルが精度とF1スコアで0.90以上を達成し、プロキシモデルでの強力な性能を示した。
  • マスキングによる無効トークンの抑制により、生成の過早終了が効果的に緩和された。事例研究では、DeSecが有効なシークレットを生成した一方、HCRやBS-5は失敗または妥当性の低い出力を示した。
  • DeepSeek-Coder-6.7Bでは、非シークレットの例(例:'AKIDz8krbsJ5yKBZQpn74WFkmLPx3EXAMPLE')の記憶が原因でスコアリングモデルの性能が制限され、誤って本物のシークレットと分類された。
  • 事例研究により、DeSecはHCR や BS-5が失敗または妥当性の低い出力を示す状況でも、妥当かつ本物のシークレットを生成できることを確認した。これは、確率再重み付けとスコアリングガイドの有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。