[論文レビュー] TOPFORMER: Topology-Aware Authorship Attribution of Deepfake Texts with Diverse Writing Styles
本稿では、トポロジカル・データ解析(TDA)をRoBERTaに統合することで、不均一で不均衡なデータセットにおいても、深く偽造されたテキストの多クラス著者属性付与を向上させるハイブリッドディープラーニングモデルTopRoBERTaを提案する。モデルのプールド出力から抽出されたトポロジカル特徴量を用いることで、異種かつ不均衡なデータセット上でのマクロF1スコアが最大7%向上し、アンサンブルRoBERTaおよびガウス拡張ベースラインを上回る性能を発揮する。
Recent advances in Large Language Models (LLMs) have enabled the generation of open-ended high-quality texts, that are non-trivial to distinguish from human-written texts. We refer to such LLM-generated texts as deepfake texts. There are currently over 72K text generation models in the huggingface model repo. As such, users with malicious intent can easily use these open-sourced LLMs to generate harmful texts and dis/misinformation at scale. To mitigate this problem, a computational method to determine if a given text is a deepfake text or not is desired--i.e., Turing Test (TT). In particular, in this work, we investigate the more general version of the problem, known as Authorship Attribution (AA), in a multi-class setting--i.e., not only determining if a given text is a deepfake text or not but also being able to pinpoint which LLM is the author. We propose TopFormer to improve existing AA solutions by capturing more linguistic patterns in deepfake texts by including a Topological Data Analysis (TDA) layer in the Transformer-based model. We show the benefits of having a TDA layer when dealing with imbalanced, and multi-style datasets, by extracting TDA features from the reshaped $pooled\_output$ of our backbone as input. This Transformer-based model captures contextual representations (i.e., semantic and syntactic linguistic features), while TDA captures the shape and structure of data (i.e., linguistic structures). Finally, TopFormer, outperforms all baselines in all 3 datasets, achieving up to 7\% increase in Macro F1 score. Our code and datasets are available at: https://github.com/AdaUchendu/topformer
研究の動機と目的
- 大規模言語モデル(LLM)によって生成される深く偽造されたテキストの検出と属性付与という、拡大する課題に取り組むこと。これらのテキストは人間が書いたものと区別がつきにくくなっている。
- 二値のチューリングテスト分類を越えて、多クラス著者属性付与を実現し、特定のテキストを生成したLLMを特定可能にする。
- ノイズが多く不均衡で多様性のあるテキストデータが一般的な現実世界のシナリオにおいて、モデルのロバスト性を向上させること。
- RoBERTaの表現力とトポロジカル・データ解析(TDA)の構造的感度を組み合わせたハイブリッドモデルを構築し、深く偽造されたテキストに潜む微細な言語的パターンを捉える。
- RoBERTaのプールド出力から抽出したTDA特徴量が、特に非一様なデータ分布において、モデルの一般化性能と性能を向上させることを実証する。
提案手法
- 入力テキストから文脈的な埋め込み(意味的・構文的特徴)を抽出するために、RoBERTa-baseを微調整し、主な表現としてプールド出力を使用する。
- reshapeされたプールド出力に対してトポロジカル・データ解析(TDA)を適用し、埋め込み空間内の言語的パターンの背後にある形状と構造を捉えるトポロジカル特徴量を抽出する。
- 最終分類ヘッドに供給する前に、TDA特徴量と元のRoBERTa埋め込みを連結することで、モデルの入力をトポロジカル不変量で拡張する。
- 持続的ホモロジーを用いてプールド出力からTDA特徴量を計算し、ノイズや分布シフトに対して耐性のある構造的パターンを検出可能にする。
- 特徴量の数がシーケンス間で異なる場合でも安定性を確保するため、サンプル間でTDA特徴量ベクトルを正規化する。
- ベースラインモデル(例:アンサンブルRoBERTa、ガウス拡張RoBERTa)との性能比較を通じて、さまざまなデータ条件下でのTDA層の貢献を検証する。
実験結果
リサーチクエスチョン
- RQ1RoBERTaにトポロジカル・データ解析(TDA)を統合することで、ノイズが多く不均衡なデータセット上での深く偽造されたテキストの著者属性付与性能が向上するか?
- RQ2TDA層は、パラフレーザーや翻訳者、複数のLLMなど多様なソースからのテキスト分類において、モデルのロバスト性を向上させるか?
- RQ3TDA層による性能向上は、モデル固有の能力によるものか、特に多様なデータ分布下でのノイズパターンによるものか?
- RQ4TDAの入力としてプールド出力を使用する場合と、アテンション重みを使用する場合とを比較した場合、安定性、計算コスト、分類精度の観点でどちらが優れているか?
- RQ5TopRoBERTaは、分布外やリソースが限られた言語設定において、特に悪意のある条件下でもどれほど一般化可能か?
主な発見
- TopRoBERTaは3つのデータセットのうち2つでアンサンブルRoBERTaを上回り、マクロF1スコアで最大7%の向上を達成した。特に異種的かつマルチドメインのデータで顕著な向上が見られた。
- 12ラベル(人間、生成者、翻訳者、パラフレーザー)を有するSynSciPassデータセットでは、7%のF1スコア向上を達成し、複雑なラベル分布への強い一般化能力を示した。
- ガウス拡張ベースライン(ガウス-BERTおよびガウス-RoBERTa)を常に上回る性能を示しており、性能向上がランダムノイズへの適応ではなく、意味的なトポロジカル特徴抽出によるものであることを示唆している。
- プールド出力から抽出したTDA特徴量は、アテンション重みから抽出した特徴量よりも安定的で情報量が多く、後者は高い分散を示し、追加の前処理を要する傾向にあった。
- PCAで次元削減した埋め込みの可視化により、TopRoBERTaの出力ではより明確で構造的なクラスタが得られ、TDAが高次元空間における特徴の分離性を向上させていることを確認した。
- 均一なデータセット(例:人間対パラフレーザー)ではTDA層にほとんど恩恵が得られないことから、主な利点は異種的かつ複雑なラベル構造の処理にあり、その点で顕著であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。