Skip to main content
QUICK REVIEW

[論文レビュー] Can social media provide early warning of retraction? Evidence from critical tweets identified by human annotation and large language models

Er‐Te Zheng, Hui‐Zhen Fu|arXiv (Cornell University)|Mar 25, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用数 3
ひとこと要約

本研究では、特定の批判的ツイートを含むソーシャルメディアが、再掲された科学的論文の早期警告システムとして機能できるかを調査している。人間によるアノテーションが施された批判的ツイート(再掲論文では8.3%、非再掲論文では1.5%)と、LLMベースの検出(GPT-4o mini、Gemini 2.0 Flash-Lite、Claude 3.5 Haiku)を組み合わせた結果、人間によるアノテーションの信号はLLM単体よりもはるかに信頼性が高く、スケーラブルで正確な研究の整合性モニタリングには人間とAIの協働アプローチが不可欠であることが示された。

ABSTRACT

Timely detection of problematic research is essential for safeguarding scientific integrity. To explore whether social media commentary can serve as an early indicator of potentially problematic articles, this study analysed 3,815 tweets referencing 604 retracted articles and 3,373 tweets referencing 668 comparable non-retracted articles. Tweets critical of the articles were identified through both human annotation and large language models (LLMs). Human annotation revealed that 8.3% of retracted articles were associated with at least one critical tweet prior to retraction, compared to only 1.5% of non-retracted articles, highlighting the potential of tweets as early warning signals of retraction. However, critical tweets identified by LLMs (GPT-4o mini, Gemini 2.0 Flash-Lite, and Claude 3.5 Haiku) only partially aligned with human annotation, suggesting that fully automated monitoring of post-publication discourse should be applied with caution. A human-AI collaborative approach may offer a more reliable and scalable alternative, with human expertise helping to filter out tweets critical of issues unrelated to the research integrity of the articles. Overall, this study provides insights into how social media signals, combined with generative AI technologies, may support efforts to strengthen research integrity.

研究の動機と目的

  • 科学的論文に関する批判的ソーシャルメディア・コメントが、将来的に再掲される論文の早期予兆として機能できるかどうかを評価すること。
  • 人間によるアノテーションが施された批判的ツイートと、大規模言語モデル(LLM)が検出するツイートの両者を比較し、後に再掲された論文を特定する際の有効性を検証すること。
  • 人間の判断と比較して、LLMが研究の整合性関連の批判を検出する際の信頼性と整合性を評価すること。
  • スケーラブルで正確な研究の整合性モニタリングのための、人間-AI協働フレームワークを提言すること。

提案手法

  • 再掲論文604件を対象に3,815件のツイート、非再掲論文668件を対象に3,373件のツイートを収集した。
  • 人間によるアノテーションを用いて、研究の整合性に関する批判的ツイートを特定し、ゴールドスタンダードデータセットを構築した。
  • GPT-4o mini、Gemini 2.0 Flash-Lite、Claude 3.5 Haikuの3つのLLMを用いて、ツイートを「批判的」と「非批判的」に分類した。
  • LLMの予測結果を人間によるアノテーションのラベルと比較し、整合性と信頼性を評価した。
  • LLMの性能を評価するため、正確率(precision)、再現率(recall)、F1スコアを算出した。
  • 人間の監視がLLM出力から研究の整合性とは関係のない批判をフィルタリングするという、人間-AI協働モデルを提言した。

実験結果

リサーチクエスチョン

  • RQ1ソーシャルメディア上の批判的ツイートは、後に再掲される科学的論文の早期兆候として機能できるか?
  • RQ2人間によるアノテーション基準と比較して、大規模言語モデル(LLM)はツイート内の研究の整合性関連の批判をどの程度正しく検出できるか?
  • RQ3人間によるアノテーションが施された批判的ツイートと、LLMが生成した分類結果との整合度はどの程度か?
  • RQ4LLM単体で、研究の整合性に関する投稿後ディス course の自動監視をどの程度信頼できるか?
  • RQ5人間-AI協働アプローチは、再掲のための早期警告システムのスケーラビリティと正確性を向上させるために果たす役割は何か?

主な発見

  • 再掲論文の8.3%は再掲以前に少なくとも1件の人的アノテーション済み批判的ツイートと関連づけられたが、非再掲論文では1.5%にとどまった。
  • 人的アノテーションデータセットは明確な信号を示しており、批判的コメントが再掲の前触れとなっている事例が有意な少数を占めていることが判明した。
  • LLMによる批判的ツイートの検出は、人的アノテーションラベルと部分的な整合性しか示さず、完全な自動化には限界があることが示唆された。
  • GPT-4o mini、Gemini 2.0 Flash-Lite、Claude 3.5 Haikuのすべてが、研究の整合性関連の批判を特定する際、顕著な偽陽性および偽陰性を示した。
  • 本研究は、分類誤りのリスクが高いため、完全な自動化によるLLM監視を慎重に行うべきであると結論づけた。
  • 人間とAIの協働アプローチが推奨される。人間の専門知識がLLMの出力をフィルタリング・検証することで、正確性と関連性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。