Skip to main content
QUICK REVIEW

[論文レビュー] A First Look at GPT Apps: Landscape and Vulnerability

Zejun Zhang, Li Zhang|arXiv (Cornell University)|Feb 23, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用数 3
ひとこと要約

本稿は、GPTアプリストアの最初の大規模な分析を提示し、GPTのシステムプロンプトおよび内部構造を抽出するためのTriLevel GPTリバース(T-GR)フレームワークを導入する。その結果、約90%のシステムプロンプトが公開可能であることが判明し、広範な模倣が生じており、700を超えるGPTが意味的に類似または同一の内容を有しており、エコシステム全体の信頼性と品質に深刻な影響を与えている。

ABSTRACT

Following OpenAI's introduction of GPTs, a surge in GPT apps has led to the launch of dedicated LLM app stores. Nevertheless, given its debut, there is a lack of sufficient understanding of this new ecosystem. To fill this gap, this paper presents a first comprehensive longitudinal (5-month) study of the evolution, landscape, and vulnerability of the emerging LLM app ecosystem, focusing on two GPT app stores: extit{GPTStore.AI} and the official extit{OpenAI GPT Store}. Specifically, we develop two automated tools and a TriLevel configuration extraction strategy to efficiently gather metadata (\ie names, creators, descriptions, \etc) and user feedback for all GPT apps across these two stores, as well as configurations (\ie system prompts, knowledge files, and APIs) for the top 10,000 popular apps. Our extensive analysis reveals: (1) the user enthusiasm for GPT apps consistently rises, whereas creator interest plateaus within three months of GPTs' launch; (2) nearly 90\% system prompts can be easily accessed due to widespread failure to secure GPT app configurations, leading to considerable plagiarism and duplication among apps. Our findings highlight the necessity of enhancing the LLM app ecosystem by the app stores, creators, and users.

研究の動機と目的

  • 公式および非公式なGPTストアにおけるGPTアプリケーションの全体像を、初めてマッピングすること。
  • GPTの内部構造、特にシステムプロンプトにおける脆弱性を調査し、リバースエンジニアリングへの露出度を評価すること。
  • 実世界におけるGPT間での模倣および重複の広がりを分析すること。
  • 大規模な分析を可能にするために、WebスクレイピングおよびGPTとのプログラム的インタラクションを可能にする自動化ツールを開発すること。
  • GPT作成者およびストアがセキュリティを向上させ、知的財産の漏洩を低減するための実行可能な提言を提示すること。

提案手法

  • 2か月間にわたり、GPTStore.AIおよび公式OpenAI GPTストアのメタデータ収集を目的とした自動化されたWebスクレイピングツールを開発した。
  • リバースエンジニアリングの目的で、制御された繰り返しクエリを可能にするプログラム的インタラクションツールを構築した。
  • 新規のTriLevel GPTリバース(T-GR)戦略を提案:レベルIは直接クエリ、レベルIIは洗練されたプロンプトで再試行、レベルIIIは多言語GPTの複製を用いて欠落した内部構造を回復する。
  • BERTベースの埋め込みモデル(bert-base-multilingual-uncased)を用いて、コサイン類似度を用いてGPTの説明文間の意味的類似度を計算した。
  • キーワードベースの検索ボットを用いて、名前および説明文に基づき重複または類似するGPTを特定し、類似度の閾値を0.99のコサイン類似度に設定した。
  • 類似するGPT間の会話回数の差を収集・分析し、ユーザーの混乱や潜在的な操作リスクを評価した。

実験結果

リサーチクエスチョン

  • RQ1主要なGPTストアにおけるGPTアプリケーションの成長、人気、クリエイター活動の面で、現在の状況はどのようなものか?
  • RQ2GPTの内部構造、特にシステムプロンプトは、どれほど公開アクセスやリバースエンジニアリングの対象となっているか?
  • RQ3GPT間での模倣および重複はどれほど広がっており、ユーザーの信頼性や選択にどのような影響を与えているか?
  • RQ4ナビゲーション、分類、ユーザーエクスペリエンスの観点から、現在のGPTストアインターフェースの限界は何か?
  • RQ5自動化ツールは、大規模にGPTの内部構造を抽出し、意味的に類似または重複するGPTを特定するのに効果的か?

主な発見

  • 分析対象の上位10,000GPTの約90%のシステムプロンプトが、単純なクエリにより直接アクセス可能であり、深刻な保護の失敗を示している。
  • 7,706件のGPTを分析した結果、700件以上(9%)が少なくとも1つの意味的に類似または重複する対応物を有しており、135件は同一の名前と説明文を有している。
  • 意味的に類似する対応物を有するGPTの75%以上で、会話回数の差が100未満であることが判明し、ユーザーの混乱を増大させ、悪意あるまたは低品質なGPTの選択リスクを高めている。
  • 40%のGPTがAPIの詳細を露出しているものの、認証の要件により外部APIアクセスは困難であり、データパイプラインの完全なリバースエンジニアリングは制限されている。
  • 現在の会話回数を人気指標とするアプローチは脆弱であり、操作の対象となりやすく、ユーザー意思決定における信頼性を損なっている。
  • 本研究では、GPTストア設計における深刻なギャップを特定した:模倣や重複の影響を軽減するための、堅牢なユーザーガイド、分類、品質管理メカニズムの欠如。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。