Skip to main content
QUICK REVIEW

[論文レビュー] SynSciPass: detecting appropriate uses of scientific text generation

Domenic Rosati|arXiv (Cornell University)|Sep 7, 2022
Topic Modeling被引用数 6
ひとこと要約

本論文では、翻訳、再表現、完全生成など、科学的執筆におけるテキスト生成ツールの種別を、人間対機械の二値分類に依存せずに検出することを目的とした合成データセットであるSynSciPassを紹介する。このデータセットで訓練されたモデルはドメインシフトに対してより頑健であり、適切なAI生成使用と不適切な使用を区別できるが、現時点の検出器は現実の科学的出版状況では信頼性に欠ける。

ABSTRACT

Approaches to machine generated text detection tend to focus on binary classification of human versus machine written text. In the scientific domain where publishers might use these models to examine manuscripts under submission, misclassification has the potential to cause harm to authors. Additionally, authors may appropriately use text generation models such as with the use of assistive technologies like translation tools. In this setting, a binary classification scheme might be used to flag appropriate uses of assistive text generation technology as simply machine generated which is a cause of concern. In our work, we simulate this scenario by presenting a state-of-the-art detector trained on the DAGPap22 with machine translated passages from Scielo and find that the model performs at random. Given this finding, we develop a framework for dataset development that provides a nuanced approach to detecting machine generated text by having labels for the type of technology used such as for translation or paraphrase resulting in the construction of SynSciPass. By training the same model that performed well on DAGPap22 on SynSciPass, we show that not only is the model more robust to domain shifts but also is able to uncover the type of technology used for machine generated text. Despite this, we conclude that current datasets are neither comprehensive nor realistic enough to understand how these models would perform in the wild where manuscript submissions can come from many unknown or novel distributions, how they would perform on scientific full-texts rather than small passages, and what might happen when there is a mix of appropriate and inappropriate uses of natural language generation.

研究の動機と目的

  • 適切に生成された科学的テキストがAI生成と誤分類されることによる悪影響を是正すること、特に査読プロセスにおける影響を想定する。
  • 翻訳や再表現などのテキスト生成ツールの種別を特定する、より洗練された検出フレームワークの開発。
  • 異なる科学的ドメインにまたがる多様な科学的テキスト生成シナリオを捉えた、現実的で包括的なデータセット(SynSciPass)の構築。
  • SynSciPassで訓練されたモデルが、未知の分布に一般化できるかどうか、および生成ツールの種別を効果的に検出できるかどうかの評価。
  • 科学的出版における支援的AI利用を踏まえた、倫理的で頑健かつ解釈可能な検出システムの推進。

提案手法

  • 翻訳、再表現、および新規生成を含む、テキスト生成ツールの階層的分類体系を提案し、各タイプにラベルを付与する。
  • 複数の科学的ドメインにまたがる多数の事前学習モデルから合成された科学的本文をサンプリングすることで、SynSciPassを構築する。
  • ドメインシフトをシミュレートするためにデータ拡張技術を用い、モデルの一般化性能を向上させる。
  • DeBERTa v3などの最先端モデルをSynSciPassで微調整し、機械生成そのものだけでなく、使用された生成ツールの種別を検出できるようにする。
  • DAGPap22およびSynSciPassの両方でベースラインモデル(例:SciBERT、TF-IDF)を訓練・評価し、分布シフト下での性能を比較する。
  • 検出タスクを二値分類から生成タイプの多クラス分類に再定式化することで、より公平な編集意思決定を支援する。

実験結果

リサーチクエスチョン

  • RQ1SynSciPassで訓練されたモデルは、翻訳、再表現、生成などのテキスト生成ツールの種別を、二値検出法よりも正確に検出できるか?
  • RQ2ドメインシフト下で、SynSciPassにおけるモデルの性能はDAGPap22における性能と比べてどうなるか?
  • RQ3SynSciPassで訓練することで、科学的テキスト生成における未知の分布への頑健性がどの程度向上するか?
  • RQ4検出フレームワークは、科学的原稿におけるAI生成の適切な使用と不適切な使用を区別できるか?
  • RQ5混合生成コンテンツを含む現実的で包括的な科学的原稿に対して、現在の検出器にどのような限界があるか?

主な発見

  • DeBERTa v3モデルをDAGPap22で訓練した場合、Scieloの機械翻訳本文ではF1スコアが31.4にとどまり、現実的状況下ではランダムな性能に近いことが示された。
  • SynSciPassでは、同じモデルが生成ツールの種別を検出する際、F1スコア98.6を達成し、細分化分類において顕著な向上が見られた。
  • SynSciPassで微調整されたモデルは、DAGPap22で訓練されたモデルと比較して、ドメインシフトに対してより頑健であることが示された。
  • 改善は見られたが、依然として未知の分布や完全な科学的原稿への一般化性能は十分ではなく、現時点の検出器は生産環境での利用にはまだ不適切である。
  • TF-IDF や SciBERT などのベースラインモデルは SynSciPass で限界的な性能を示し、より洗練されたアーキテクチャの必要性が浮き彫りになった。
  • 本研究は、現在のデータセットおよび検出器が、科学的出版における安全な導入を支援するには、十分に包括的かつ現実的ではないと結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。