[논문 리뷰] TOPFORMER: Topology-Aware Authorship Attribution of Deepfake Texts with Diverse Writing Styles
이 논문은 대규모 언어 모델(Large Language Models, LLMs)에 의해 생성된 딥패이크 텍스트의 다중 클래스 저자 소속 할당을 향상시키기 위해 위상적 데이터 분석(Topological Data Analysis, TDA)을 RoBERTa에 통합한 하이브리드 딥러닝 모델인 TopRoBERTa를 제안한다. 모델의 풀드 출력에서 위상적 특징을 추출함으로써, 이질적이고 불균형한 데이터셋에서 매크로 F1 스코어가 최대 7% 향상되며, 기존 RoBERTa 및 가우시안 증강 기반 모델보다 뛰어난 성능을 보인다.
Recent advances in Large Language Models (LLMs) have enabled the generation of open-ended high-quality texts, that are non-trivial to distinguish from human-written texts. We refer to such LLM-generated texts as deepfake texts. There are currently over 72K text generation models in the huggingface model repo. As such, users with malicious intent can easily use these open-sourced LLMs to generate harmful texts and dis/misinformation at scale. To mitigate this problem, a computational method to determine if a given text is a deepfake text or not is desired--i.e., Turing Test (TT). In particular, in this work, we investigate the more general version of the problem, known as Authorship Attribution (AA), in a multi-class setting--i.e., not only determining if a given text is a deepfake text or not but also being able to pinpoint which LLM is the author. We propose TopFormer to improve existing AA solutions by capturing more linguistic patterns in deepfake texts by including a Topological Data Analysis (TDA) layer in the Transformer-based model. We show the benefits of having a TDA layer when dealing with imbalanced, and multi-style datasets, by extracting TDA features from the reshaped $pooled\_output$ of our backbone as input. This Transformer-based model captures contextual representations (i.e., semantic and syntactic linguistic features), while TDA captures the shape and structure of data (i.e., linguistic structures). Finally, TopFormer, outperforms all baselines in all 3 datasets, achieving up to 7\% increase in Macro F1 score. Our code and datasets are available at: https://github.com/AdaUchendu/topformer
연구 동기 및 목표
- 대규모 언어 모델(LLMs)에 의해 생성되는 딥패이크 텍스트를 탐지하고 저자 소속을 할당하는 데 점점 더 어려워지는 도전 과제를 해결한다.
- 이중 테스팅 분류를 넘어 다중 클래스 저자 소속 할당으로 확장하여, 주어진 텍스트를 생성한 특정 LLM을 식별할 수 있도록 한다.
- 노이즈가 많고 불균형하며 이질적인 텍스트 데이터가 흔한 실생활 환경에서의 강건성을 향상시킨다. 이는 LLM에 의해 생성된 텍스트 탐지에 일반적인 특성이다.
- RoBERTa의 표현 능력과 위상적 데이터 분석(TDA)의 구조적 민감성의 장점을 융합한 하이브리드 모델을 개발하여, 딥패이크 텍스트 내의 미세한 언어 패턴을 포착한다.
- RoBERTa의 풀드 출력에서 추출한 TDA 특징이 모델의 일반화 능력과 성능을 향상시키며, 특히 복잡하고 비균일한 데이터 분포에서 효과적임을 입증한다.
제안 방법
- 입력 텍스트로부터 문맥 임베딩(의미적 및 문법적 특징)을 추출하기 위해 RoBERTa-base를 미세조정하며, 주로 풀드 출력(pooled_output)을 주된 표현으로 사용한다.
- 재형식화된 풀드 출력에 위상적 데이터 분석(TDA)을 적용하여, 임베딩 공간 내 언어 패턴의 기저 구조와 형태를 포착하는 위상적 특징을 추출한다.
- 최종 분류 헤드에 입력하기 전에 TDA 특징을 원본 RoBERTa 임베딩과 연결함으로써, 모델의 입력에 위상적 불변량을 효과적으로 보강한다.
- 지속성 호모로지(persistent homology)를 사용하여 풀드 출력에서 TDA 특징을 계산함으로써, 노이즈와 분포 이동에 강건한 구조적 패턴을 탐지할 수 있도록 한다.
- 특징 수가 문장 간에 다를 수 있는 상황에서의 안정성을 확보하기 위해, 샘플 간 TDA 특징 벡터를 정규화한다.
- 다양한 데이터 조건에서 TDA 레이어의 기여도를 검증하기 위해, 기준 모델들(예: 기존 RoBERTa, 가우시안-RoBERTa)과의 성능을 비교한다.
실험 결과
연구 질문
- RQ1RoBERTa에 위상적 데이터 분석(TDA)을 통합함으로써, 노이즈가 많고 불균형한 데이터셋에서 딥패이크 텍스트의 저자 소속 할당 성능을 향상시킬 수 있는가?
- RQ2다양한 출처(예: 번역기, 요약기, 여러 LLM)에서 온 텍스트를 분류할 때 TDA 레이어가 모델의 강건성을 향상시키는가?
- RQ3TDA 레이어의 성능 향상은 모델 자체의 용량 때문인지, 특히 이질적인 데이터 분포에서의 데이터 특유의 노이즈 패턴 때문인가?
- RQ4TDA에 풀드 출력을 입력으로 사용하는 것과 어텐션 웨이트를 사용하는 것 사이에서, 안정성, 계산 비용, 분류 정확도 측면에서 어떤 것이 더 우수한가?
- RQ5특히 악성 조건에서, TopRoBERTa가 분포 외(out-of-distribution) 및 자원이 제한된 언어 환경으로의 일반화 능력은 어느 정도인가?
주요 결과
- TopRoBERTa는 3개 데이터셋 중 2개에서 기존 RoBERTa를 능가하며, 특히 이질적이고 다중 도메인 데이터에서 매크로 F1 스코어가 최대 7% 향상된다.
- 12개 레이블(인간, 생성기, 번역기, 요약기)을 포함하는 SynSciPass 데이터셋에서 7%의 F1 향상을 달성하여, 복잡한 레이블 분포에 대한 강력한 일반화 능력을 보여준다.
- 가우시안 증강 기반 모델(Gaussian-BERT 및 Gaussian-RoBERTa)보다 일관되게 뛰어난 성능을 보이며, 성능 향상의 원인이 무작위 노이즈 적응이 아니라 의미 있는 위상적 특징 추출 때문임을 시사한다.
- 풀드 출력에서 추출한 TDA 특징는 어텐션 웨이트에서 유도된 특징보다 더 안정적이고 정보량이 많으며, 어텐션 웨이트 기반 특징은 높은 변동성과 추가 전처리가 필요함을 확인한다.
- PCA로 압축한 임베딩의 시각화 결과, TopRoBERTa의 출력에서 더 명확하고 구조적인 클러스터가 관찰되어, TDA가 고차원 공간에서 특징의 분리 가능성을 향상시킨다는 것을 확인한다.
- 동질적인 데이터셋(예: 인간 대 요약기)에서는 TDA 레이어의 기여가 미미함을 확인하여, 이 레이어의 주요 이점이 이질적이고 복잡한 레이블 구조 처리에 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.