Skip to main content
QUICK REVIEW

[论文解读] A First Look at GPT Apps: Landscape and Vulnerability

Zejun Zhang, Li Zhang|arXiv (Cornell University)|Feb 23, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用 3
一句话总结

本文首次对GPT应用商店进行了大规模分析,提出了TriLevel GPT逆向框架(T-GR),用于从GPT中提取系统提示和内部结构。研究发现,近90%的系统提示可公开访问,导致广泛抄袭现象,超过700个GPT存在语义相似或内容重复的情况,严重损害了生态系统的可信度与质量。

ABSTRACT

Following OpenAI's introduction of GPTs, a surge in GPT apps has led to the launch of dedicated LLM app stores. Nevertheless, given its debut, there is a lack of sufficient understanding of this new ecosystem. To fill this gap, this paper presents a first comprehensive longitudinal (5-month) study of the evolution, landscape, and vulnerability of the emerging LLM app ecosystem, focusing on two GPT app stores: extit{GPTStore.AI} and the official extit{OpenAI GPT Store}. Specifically, we develop two automated tools and a TriLevel configuration extraction strategy to efficiently gather metadata (\ie names, creators, descriptions, \etc) and user feedback for all GPT apps across these two stores, as well as configurations (\ie system prompts, knowledge files, and APIs) for the top 10,000 popular apps. Our extensive analysis reveals: (1) the user enthusiasm for GPT apps consistently rises, whereas creator interest plateaus within three months of GPTs' launch; (2) nearly 90\% system prompts can be easily accessed due to widespread failure to secure GPT app configurations, leading to considerable plagiarism and duplication among apps. Our findings highlight the necessity of enhancing the LLM app ecosystem by the app stores, creators, and users.

研究动机与目标

  • 首次对官方及非官方GPT商店中的GPT应用生态进行全面测绘。
  • 调查GPT内部结构,特别是系统提示的漏洞,评估其遭受逆向工程的风险。
  • 分析现实世界中GPT之间抄袭与重复的普遍性。
  • 开发自动化工具用于网络爬取和与GPT的程序化交互,以支持大规模分析。
  • 为GPT创作者和应用商店提出切实可行的建议,以提升安全性并减少知识产权泄露。

提出的方法

  • 开发了自动化网络爬虫工具,在为期两个月的时间内从GPTStore.AI和官方OpenAI GPT商店收集元数据。
  • 构建了程序化交互工具,支持对GPT进行受控且可重复的查询,以实现逆向工程目的。
  • 提出了一种新颖的TriLevel GPT逆向(T-GR)策略:一级通过直接查询,二级通过优化提示重试,三级则采用跨语言GPT复制以恢复缺失的内部结构。
  • 采用基于BERT的嵌入模型(bert-base-multilingual-uncased)计算GPT描述之间的语义相似度,使用余弦相似度进行度量。
  • 使用基于关键词的搜索机器人,通过名称和描述识别重复或相似的GPT,相似度阈值设定为0.99余弦相似度。
  • 收集并分析语义相似GPT之间的对话数量差异,以评估用户混淆程度及潜在的操纵风险。

实验结果

研究问题

  • RQ1在主要GPT商店中,GPT应用的当前生态格局如何?包括增长趋势、受欢迎程度及创作者活跃度?
  • RQ2GPT内部结构,特别是系统提示,暴露于公众访问和逆向工程的程度如何?
  • RQ3GPT之间的抄袭与重复现象有多普遍?这对用户信任和选择行为有何影响?
  • RQ4当前GPT商店界面在导航、分类和用户体验方面存在哪些局限性?
  • RQ5自动化工具能否在大规模范围内有效提取GPT内部结构,并识别语义相似或重复的GPT?

主要发现

  • 在分析的前10,000个GPT中,近90%的系统提示可通过简单查询直接获取,表明存在严重的保护机制失效。
  • 在分析的7,706个GPT中,超过700个(占9%)至少存在一个语义相似或内容重复的对应版本,其中135个拥有完全相同的名称和描述。
  • 超过75%的具有语义相似对应版本的GPT,其对话数量差异小于100,显著增加了用户混淆,也提高了选择恶意或低质量GPT的风险。
  • 尽管40%的GPT暴露了API详情,但外部API访问仍因认证要求而困难,限制了对数据管道的完整逆向工程。
  • 当前依赖对话数量作为流行度指标的方式极为脆弱,易受操纵,严重削弱了其在用户决策中的可靠性。
  • 本研究识别出GPT商店设计中的一个关键缺陷:缺乏稳健的用户引导、分类机制与质量控制手段,难以缓解重复与抄袭带来的负面影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。