Skip to main content
QUICK REVIEW

[논문 리뷰] A First Look at GPT Apps: Landscape and Vulnerability

Zejun Zhang, Li Zhang|arXiv (Cornell University)|2024. 02. 23.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 논문은 GPT 애플리케이션 스토어에 대한 최초의 대규모 분석을 제시하며, GPT의 시스템 프롬프트와 내부 구조를 추출하기 위해 TriLevel GPT Reversing (T-GR) 프레임워크를 도입한다. 분석 결과, 거의 90%의 시스템 프롬프트가 공개적으로 접근 가능하며, 이로 인해 광범위한 표절이 발생하고 있으며, 700개 이상의 GPT가 의미적으로 유사하거나 복제된 콘텐츠를 보이고 있어 생태계의 신뢰성과 품질을 약화시키고 있다.

ABSTRACT

Following OpenAI's introduction of GPTs, a surge in GPT apps has led to the launch of dedicated LLM app stores. Nevertheless, given its debut, there is a lack of sufficient understanding of this new ecosystem. To fill this gap, this paper presents a first comprehensive longitudinal (5-month) study of the evolution, landscape, and vulnerability of the emerging LLM app ecosystem, focusing on two GPT app stores: extit{GPTStore.AI} and the official extit{OpenAI GPT Store}. Specifically, we develop two automated tools and a TriLevel configuration extraction strategy to efficiently gather metadata (\ie names, creators, descriptions, \etc) and user feedback for all GPT apps across these two stores, as well as configurations (\ie system prompts, knowledge files, and APIs) for the top 10,000 popular apps. Our extensive analysis reveals: (1) the user enthusiasm for GPT apps consistently rises, whereas creator interest plateaus within three months of GPTs' launch; (2) nearly 90\% system prompts can be easily accessed due to widespread failure to secure GPT app configurations, leading to considerable plagiarism and duplication among apps. Our findings highlight the necessity of enhancing the LLM app ecosystem by the app stores, creators, and users.

연구 동기 및 목표

  • 공식 및 비공식 GPT 스토어 내 GPT 애플리케이션의 전반적인 환경을 최초로 맵핑하기 위해.
  • 특히 시스템 프롬프트를 포함한 GPT 내부의 취약성과 그들이 역공학에 노출된 정도를 조사하고 평가하기 위해.
  • 실세계에서 GPT 간의 표절과 중복의 빈도를 분석하기 위해.
  • 대규모 분석을 가능하게 하기 위해 웹 스크래핑 및 GPT와의 프로그래밍적 상호작용을 위한 자동화된 도구를 개발하기 위해.
  • GPT 제작자 및 스토어가 보안을 강화하고 지적 재산 유출을 줄이기 위한 실천 가능한 권고안을 제안하기 위해.

제안 방법

  • 두 달 간의 기간 동안 GPTStore.AI와 공식 OpenAI GPT 스토어에서 메타데이터를 수집하기 위해 자동화된 웹 스크래핑 도구를 개발하였다.
  • 역공학 목적의 제어된 반복 쿼리 가능성을 확보하기 위해 프로그래밍적 상호작용 도구를 구축하였다.
  • 새로운 TriLevel GPT Reversing (T-GR) 전략을 제안함: Level I은 직접 쿼리를 사용하고, Level II는 보완된 프롬프트로 재시도하며, Level III는 다국어 GPT 복제를 통해 누락된 내부 정보를 복원한다.
  • BERT 기반 임베딩 모델(bert-base-multilingual-uncased)을 활용하여 코사인 유사도를 사용해 GPT 설명 간의 의미적 유사도를 계산하였다.
  • 유사도 임계값을 0.99 코사인 유사도로 설정하여 이름과 설명을 기반으로 키워드 기반 검색 봇을 사용해 중복 또는 유사한 GPT를 식별하였다.
  • 유사한 GPT 간의 대화 수 차이를 수집하고 분석하여 사용자 혼동과 잠재적 조작 위험을 평가하였다.

실험 결과

연구 질문

  • RQ1주요 GPT 스토어 내 GPT 애플리케이션의 성장, 인기, 제작자 활동 측면에서 현재의 환경은 어떠한가?
  • RQ2GPT 내부, 특히 시스템 프롬프트가 공개 접근 및 역공학에 얼마나 노출되어 있는가?
  • RQ3표절과 중복은 얼마나 퍼져 있으며, 이는 사용자 신뢰와 선택에 어떤 영향을 미치는가?
  • RQ4나비게이션, 분류, 사용자 경험 측면에서 현재의 GPT 스토어 인터페이스에는 어떤 한계가 있는가?
  • RQ5자동화된 도구가 대규모로 GPT 내부를 추출하고 의미적으로 유사하거나 복제된 GPT를 식별하는 데 효과적으로 기능하는가?

주요 결과

  • 분석한 상위 10,000개 GPT 중 거의 90%의 시스템 프롬프트가 간단한 쿼리로 직접 접근 가능하며, 이는 심각한 보안 실패를 시사한다.
  • 7,706개의 GPT 중 700개 이상(9%)이 의미적으로 유사하거나 복제된 대체 버전을 보이며, 135개는 동일한 이름과 설명을 가진다.
  • 의미적으로 유사한 대체 버전을 가진 GPT의 75% 이상이 대화 수가 100 이내로 차이가 나며, 이는 사용자 혼동을 증가시키고 악성 또는 저품질 GPT를 선택할 위험을 높인다.
  • 40%의 GPT가 API 세부 정보를 유출하고 있음에도 불구하고, 인증 요구 조건으로 인해 외부 API 접근은 여전히 어렵고, 데이터 파이프라인의 완전한 역공학은 제한된다.
  • 현재 대화 수를 인기 지표로 사용하는 것은 취약하며 조작에 취약하여 사용자 의사결정에 있어 신뢰성에 악영향을 미친다.
  • 본 연구는 GPT 스토어 설계의 심각한 격차를 밝혀내었으며, 중복과 표절의 영향을 완화하기 위한 강력한 사용자 안내, 분류, 품질 제어 메커니즘이 부족하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.