[논문 리뷰] Anatomy of an AI-powered malicious social botnet
본 연구는 ChatGPT를 사용해 해로운 콘텐츠를 생성하는 fox8로 명명된 Twitter 봇넷을 문서화하고, 이들의 협력적 행동을 분석하며, 탐지 방법을 평가한다. 현재의 LLM-콘텐츠 탐지기가 이러한 봇을 인간과 구분하는 데 어려움을 보인다는 점을 보여준다.
Large language models (LLMs) exhibit impressive capabilities in generating realistic text across diverse subjects. Concerns have been raised that they could be utilized to produce fake content with a deceptive intention, although evidence thus far remains anecdotal. This paper presents a case study about a Twitter botnet that appears to employ ChatGPT to generate human-like content. Through heuristics, we identify 1,140 accounts and validate them via manual annotation. These accounts form a dense cluster of fake personas that exhibit similar behaviors, including posting machine-generated content and stolen images, and engage with each other through replies and retweets. ChatGPT-generated content promotes suspicious websites and spreads harmful comments. While the accounts in the AI botnet can be detected through their coordination patterns, current state-of-the-art LLM content classifiers fail to discriminate between them and human accounts in the wild. These findings highlight the threats posed by AI-enabled social bots.
연구 동기 및 목표
- 트위터상의 실제 세계 AI 기반 소셜 봇넷을 식별하고 특성화한다.
- LLM이 인간과 유사한 콘텐츠와 가짜 페르소나를 만들어내는 데 어떻게 활용되는지 이해한다.
- 기존 콘텐츠 탐지기와 봇 탐지 도구를 사용해 LLM-활용 봇의 탐지 가능성을 평가한다.
- 연구 커뮤니티를 위한 데이터와 인사이트를 제공하여 AI 기반 봇넷에 대한 추가 연구를 촉진한다.
제안 방법
- AI 언어 모델을 언급하는 자기 노출 트윗을 통해 봇넷 계정을 식별한다.
- 일부 계정을 주석 처리해 사람일 가능성과 봇 여부를 분류하고 fox8-23 벤치마크 데이터세트를 구축한다.
- fox8 봇과 기준 인간의 프로필, 소셜 네트워크 구조, 콘텐츠 패턴(오리지널, 답글, 리트윗)을 특성화한다.
- Botometer, OpenAI AI Text Classifier, GPTZero를 사용해 봇 대 인간 콘텐츠의 탐지 접근법을 평가한다.
- 자격 트윗에 대한 평균 OpenAI 탐지기 점수를 사용해 계정 수준의 탐지기를 제안하고 LLM-활용 봇을 분류한다.
실험 결과
연구 질문
- RQ1실제 트위터 계정이 LLM-활용 콘텐츠 생성을 사용해 협력적 악의적 봇넷을 형성하는가?
- RQ2이러한 AI 기반 봇의 행동 및 네트워크 패턴은 인간과 어떻게 비교되는가?
- RQ3현존하는 LLM-콘텐츠 탐지기와 봇 탐지기가 현장에서 이 봇들을 인간과 신뢰성 있게 구분할 수 있는가?
- RQ4LLM 생성 콘텐츠 신호로부터 실용적인 탐지 접근법을 구축해 LLM-활용 봇을 식별할 수 있는가?
주요 결과
- 1,140개의 dense cluster의 fox8 봇 계정이 서로를 팔로우하고 상호 답글/리트윗에 관여한다.
- 봇은 오리지널 트윗, 답글, 리트윗의 혼합을 게시하며 평균 25.6% 오리지널, 36.1% 답글, 38.4% 리트윗/인용(표준편차 제공)이다.
- 의심스러운 웹사이트 세 곳(cryptnomics.org, fox8.news, globaleconomics.news)이 자주 공유되며, 계정들이 보트넷 신호의 일부로 이들에 연결된다.
- 자기 노출 트윗은 ChatGPT와 유사한 프롬프트의 사용을 나타내며, 81.3%가 OpenAI 가이드라인과 관련된 해로운/부정적 콘텐츠 지시를 보이고; 나머지는 금지사항이나 능력 초과 프롬프트를 보인다.
- 봇 탐지 도구로 fox8 봇을 식별하지 못한다: Botometer 분포는 좌측으로 왜곡되었고 임계값 2.5에서 재현율이 거의 0에 가깝다.
- 해당 데이터셋에서 트윗 수준의 OpenAI의 AI 텍스트 분류기가 이 봇 신호와 인간 신호를 GPTZero보다 더 잘 구분할 수 있어, 임계값 52.7에서 F1 점수 0.84의 계정 수준 탐지기를 가능하게 한다; 무작위 계정 간에는 중복이 보이며 위양성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.