Skip to main content
QUICK REVIEW

[論文レビュー] TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs

Rajore, Tanmay, Nishanth Chandran|arXiv (Cornell University)|Mar 1, 2024
International Arbitration and Investment LawBusiness, Management and Accounting被引用数 3
ひとこと要約

この論文では、暗号技術および機密計算技術を用いてテストデータセットをモデルから完全に隔離することで、大規模言語モデル(LLM)のベンチマーキング汚染を防ぐ、Private Benchmarkingと呼ばれる新規フレームワークを提案する。これにより、データを露呈させることなく安全かつ監査可能なLLMの評価が可能となり、事前学習や微調整におけるデータ漏洩のリスクを軽減する。

ABSTRACT

Benchmarking is the de-facto standard for evaluating LLMs, due to its speed, replicability and low cost. However, recent work has pointed out that the majority of the open source benchmarks available today have been contaminated or leaked into LLMs, meaning that LLMs have access to test data during pretraining and/or fine-tuning. This raises serious concerns about the validity of benchmarking studies conducted so far and the future of evaluation using benchmarks. To solve this problem, we propose Private Benchmarking, a solution where test datasets are kept private and models are evaluated without revealing the test data to the model. We describe various scenarios (depending on the trust placed on model owners or dataset owners), and present solutions to avoid data contamination using private benchmarking. For scenarios where the model weights need to be kept private, we describe solutions from confidential computing and cryptography that can aid in private benchmarking. We build an end-to-end system, TRUCE, that enables such private benchmarking showing that the overheads introduced to protect models and benchmark are negligible (in the case of confidential computing) and tractable (when cryptographic security is required). Finally, we also discuss solutions to the problem of benchmark dataset auditing, to ensure that private benchmarks are of sufficiently high quality.

研究の動機と目的

  • 大規模言語モデル(LLM)の事前学習や微調整におけるベンチマーキングデータセットの汚染という深刻な問題に対処すること。
  • 評価中、モデルがテストデータにアクセスしないように、テストデータを完全に機密に保つ安全な評価フレームワークを開発すること。
  • データセットの品質を露呈せずに検証可能な暗号技術的手法を用いて、プライベートベンチマーキングに対する信頼性を確保すること。
  • TEE(信頼実行環境)とゼロ知識証明を用いて、オープンソース、クローズドソース、プライバシー保護型の多様な信頼モデルを実現すること。
  • SPECやサイバーセキュリティ分野のTrusteシールに類似した、産業横断的で安全なベンチマーキングプラットフォームの基盤を構築すること。

提案手法

  • Private Benchmarkingは、テストデータセットを暗号化または暗号的コミットメントで保持することで、評価中、モデルが生データにアクセスしないようにする。
  • ハッシュベースの暗号的コミットメントを用いてベンチマーキングデータポイントを束縛し、監査官が完全なデータセットを暴露せずに品質を検証できるようにする。
  • 同一のベンチマーキングが監査と評価の両方で使用されていることを証明するためのゼロ知識証明を採用し、不正な置き換え攻撃を防止する。
  • 信頼実行環境(TEEs)を活用して、重みやデータを露呈せずにモデルを安全にホスティング・評価する。
  • 監査官が暗号的コミットメントされたデータポイントをランダムにサンプリングし、代表的なサブセットをテストすることで、データセットの品質に統計的保証を与える。
  • 安全なマルチパーティ計算と機密計算を統合し、モデル重みが機密のままである状況をサポートする。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデル(LLM)の評価中に、事前学習や微調整による汚染を防ぐために、テストデータセットをどのようにモデルから完全に隔離できるか。
  • RQ2暗号技術および信頼実行環境(TEE)を用いて、監査段階と評価段階の両方でプライベートベンチマーキングの整合性と完全性をどのように保証できるか。
  • RQ3完全なデータセットにアクセスできない状況で、監査官がプライベートベンチマーキングの品質をどのように検証できるか。
  • RQ4プライベートベンチマーキングにおいて実現可能な信頼モデルは何か。また、それらはプライバシー、セキュリティ、実用性のバランスをどのようにとるか。
  • RQ5プライベートベンチマーキングは、競争上の優位性を損なわせることなく、産業横断的で安全な評価プラットフォームを実現できるか。

主な発見

  • Private Benchmarkingは、モデルがテストデータにアクセスすることを完全に防止し、事前学習や微調整による汚染リスクを排除する。
  • 暗号的コミットメントにより、監査官は少なくともα%のデータが高品質であることを高い信頼性で検証可能であり、誤差確率はκ個のサンプルに対して約(α/100)^κとなる。
  • ゼロ知識証明により、監査で使用されたベンチマーキングと評価で使用されたベンチマーキングが同一であることが保証され、悪意ある所有者の置き換え攻撃を防止する。
  • TEEベースのソリューションは、ゼロ知識証明を必要としないため、検証プロセスを簡素化する。
  • 本フレームワークは、オープンソースモデル、信頼できる所有者を有するクローズドモデル、機密計算を用いたプライバシー保護型評価を含む、多様な展開モデルをサポートする。
  • 本手法により、SPECやTrusteシールに類似した、安全で監査可能なベンチマーキングプラットフォームの構築が可能となり、業界標準としての基盤が築ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。