[논문 리뷰] MALCOM: Generating Malicious Comments to Attack Neural Fake News Detection Models
이 논문은 최첨단 신경망 기반 가짜 뉴스 탐지 모델을 속이기 위해 현실적이고 댓글 기반의 공격을 만드는 엔드 투 엔드 적대적 댓글 생성 프레임워크인 Malcom을 제안한다. Malcom은 화이트박스 및_BLK박스 설정에서 각각 94%와 93.5%의 공격 성공률를 기록하며, 탐지기들이 진짜 뉴스를 가짜로 잘못 분류하거나 가짜 뉴스를 진짜로 잘못 분류하게 유도하는 도구가 되는 도전적인 일관성 있는 댓글을 생성한다.
In recent years, the proliferation of so-called "fake news" has caused much disruptions in society and weakened the news ecosystem. Therefore, to mitigate such problems, researchers have developed state-of-the-art models to auto-detect fake news on social media using sophisticated data science and machine learning techniques. In this work, then, we ask "what if adversaries attempt to attack such detection models?" and investigate related issues by (i) proposing a novel threat model against fake news detectors, in which adversaries can post malicious comments toward news articles to mislead fake news detectors, and (ii) developing MALCOM, an end-to-end adversarial comment generation framework to achieve such an attack. Through a comprehensive evaluation, we demonstrate that about 94% and 93.5% of the time on average MALCOM can successfully mislead five of the latest neural detection models to always output targeted real and fake news labels. Furthermore, MALCOM can also fool black box fake news detectors to always output real news labels 90% of the time on average. We also compare our attack model with four baselines across two real-world datasets, not only on attack performance but also on generated quality, coherency, transferability, and robustness.
연구 동기 및 목표
- 최첨단 신경망 기반 가짜 뉴스 탐지 모델이 사용자 생성 댓글을 통한 적대적 공격에 얼마나 취약한지 조사하기 위해.
- 기존 공격가들이 기사 제목이나 내용만 조작하는 데 집중하는 데 반해, 소셜 미디어 댓글에는 초점을 두지 않는 격차를 메우기 위해.
- 대상 기사의 소유권이 없더라도 현실적이고 일관되며 매우 효과적인 적대적 댓글을 생성하는 실용적인 엔드 투 엔드 프레임워크를 개발하기 위해.
- 화이트박스 및 블랙박스 설정 전반에서 공격 성공률를 평가하고, 이식성과 방어 메커니즘 하에서의 강건성도 검토하기 위해.
- 악성 댓글이 가짜 뉴스를 홍보하는 데서만 쓰이는 것이 아니라, 진짜 뉴스를 낮추는 데에도 사용될 수 있음을 입증하여 공격의 사회적 영향을 증대시키기 위해.
제안 방법
- Malcom은 조건부 variational autoencoder(CVAE)와 스타일 인식 생성기로 구성되어 있어, 의미적으로 일관되고 실제 사용자 댓글의 스타일과 일치하는 댓글을 생성한다.
- 목표 공격 모듈을 통합하여, 대상 기사가 특정 레이블(진실 또는 가짜)로 잘못 분류될 확률을 최대화하도록 댓글 생성을 최적화한다.
- 프레임워크는 CopyCat을 통한 검색 기반의 초기 댓글 선택을 사용하여 기사 주제와 대상 레이블에 기반해 관련성 있고 고품질의 시작 댓글을 선별한다.
- Malcom은 언어적 품질과 일관성을 향상시키는 스타일 모듈과 공격 성공률를 극대화하는 공격 모듈을 결합하여 양자 모두를 공동 최적화한다.
- 공격는 화이트박스 및 블랙박스 설정 모두에서 구현되었으며, 다섯 개의 최첨단 가짜 뉴스 탐지 모델 간 이식성도 테스트되었다.
- 절단 실험을 통해 스타일 모듈과 공격 모듈의 필요성을 입증하였으며, 둘 중 하나를 제거하면 일관성 또는 공격 성공률가 크게 떨어짐을 확인하였다.
실험 결과
연구 질문
- RQ1최첨단 신경망 기반 가짜 뉴스 탐지기들을 효과적으로 속일 수 있는 현실적이고 효과적인 적대적 댓글을 생성할 수 있는가?
- RQ2Malcom은 기존 베이스라인 대비 화이트박스 및 블랙박스 가짜 뉴스 탐지 모델에 대해 얼마나 효과적인가?
- RQ3Malcom이 생성한 댓글은 일관성과 관련성 덕분에 방어 메커니즘에 의해 쉽게 탐지되지 않을 정도로 얼마나 오랫동안 임의로 유지될 수 있는가?
- RQ4공격가가 진짜 뉴스를 가짜로 잘못 분류하고 가짜 뉴스를 진짜로 잘못 분류하는 데 성공할 수 있는가? 이는 이중 방향 공격 능력을 입증한다.
- RQ5Malcom의 스타일 및 공격 구성 요소는 개별적으로나 함께 작용할 때 전체 공격 성능과 댓글 품질에 어떻게 기여하는가?
주요 결과
- Malcom은 최첨단 가짜 뉴스 탐지 모델 5종을 대상으로 화이트박스 설정에서 평균 94%의 공격 성공률로 목표 레이블(진실 또는 가짜)로 잘못 예측하도록 성공적으로 속였다.
- 블랙박스 설정에서는 평균 90%의 공격 성공률를 기록하여 다양한 모델 간 뛰어난 이식성과 함께 강력한 성능을 입증하였다.
- GossipCop 데이터셋에서 Malcom은 화이트박스 설정에서 98.1%의 공격 성공률를 기록하였으며, 공격 성능 및 댓글 품질 양면에서 모든 베이스라인을 압도하였다.
- 절단 실험 결과, 스타일 모듈을 제거하면 일관성과 품질이 떨어지고, 공격 모듈을 제거하면 공격 성공률가 급격히 감소함을 확인하여 두 구성 요소가 필수적임을 입증하였다.
- Malcom이 생성한 댓글은 베이스라인 방법보다 훨씬 더 일관성 있고 다양성이 뛰어나며, ROUGE-L 및 BERTScore 지표가 높아 목표 기사와 더 나은 의미적 일치를 보였다.
- 강력한 방어 시스템(저품질 또는 관련 없는 댓글을 필터링) 하에서도 Malcom은 높은 공격 성공률를 유지하여 탐지 메커니즘에 대한 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.