Skip to main content
QUICK REVIEW

[論文レビュー] Decontamination of the scientific literature

Guillaume Cabanac|arXiv (Cornell University)|Oct 28, 2022
Artificial Intelligence in Healthcare and Education被引用数 6
ひとこと要約

本論文は、誤ったまたは不正な論文を特定・是正する(治療的)およびAI駆動のツールとコミュニティ参加による今後の不正を防ぐ(予防的)という二重のアプローチを提唱する。自動スクリーニングツール(例:Seek&Blastn)や、コミュニティが参加するプラットフォーム(例:Problematic Paper Screener)を導入し、遺伝子配列、画像操作、AI生成テキストにおける誤りを特定する。その目的は科学的信頼を回復させ、研究の整合性を向上させることである。

ABSTRACT

Research misconduct and frauds pollute the scientific literature. Honest errors and malevolent data fabrication, image manipulation, journal hijacking, and plagiarism passed peer review unnoticed. Problematic papers deceive readers, authors citing them, and AI-powered literature-based discovery. Flagship publishers accepted hundreds flawed papers despite claiming to enforce peer review. This application ambitions to decontaminate the scientific literature using curative and preventive actions.

研究の動機と目的

  • 科学的信頼を損なう研究不正、不正行為、誤った出版の増加という深刻な危機に対処すること。
  • 既に出版された欠陥のある論文(特にペーパーミルから出たもの、画像操作、AI生成テキストを含む)を特定・是正すること。
  • 大規模言語モデル(LLM)が生成する科学的コンテンツといった、新たな脅威に対応するための検出ツールを開発することで、今後の汚染を防ぐこと。
  • 研究者、査読者、一般公衆が誤りを検出し報告できる仕組みを整備することで、透明性と再現性を向上させること。
  • 教育、マスコミ連携、市民科学の取り組みを通じて、研究の整合性に関する啓発を促進すること。

提案手法

  • BLASTベースの配列アラインメントを用いて、がん関連文献における誤ったDNA配列の主張を検出する自動ソフトウェア(例:Seek&Blastn)を開発・展開する。
  • オープン(Crossref)およびサブスクリプション型のデータソースから得た9000万件以上の文献記録を対象に、テキストおよびデータマイニングを実施し、異常を特定する。
  • 誤り検出の可視化とクラウドソーシングを可能にするオンラインダッシュボード(例:Problematic Paper Screener、COVID19 Preprint Monitor)を導入する。
  • 自然言語処理と知識ベースの検証(例:遺伝子的主張の検証にBLASTを活用)を用いて、科学的テキスト内の疑わしいまたは捏造された内容を特定する。
  • 物理学・生物学の研究者と共同で、ナノバイオロジー分野における懸念される主張の再現を試み、分野全体の誇張された期待値を検証する。
  • PubPeerやRetraction Watchの調査結果を教育カリキュラムに統合し、研究者が科学文献を的確に評価する能力を養う。

実験結果

リサーチクエスチョン

  • RQ1自動化されたツールは、数千件にのぼるがん関連論文における遺伝子配列データの誤った主張を、どのように特定・是正できるか?
  • RQ2学術文献におけるAI生成科学的テキストや捏造データを特定するための最も効果的な方法は何か?
  • RQ3欠陥のある科学的主張は、研究コミュニティ内でどのように広がり、そして是正されたり、長期間残ったりする要因は何か?
  • RQ4クラウドソーシングと一般参加による取り組みは、科学文献の誤り検出および浄化に、どの程度効果を発揮できるか?
  • RQ5教育的取り組みやマスコミ連携は、一般および研究者における研究の整合性と誤り検出の意識をどの程度高められるか?

主な発見

  • Seek&Blastnツールは、誤ったDNA配列標的化に関する主張を数百件も特定し、欠陥のある研究の体系的是正を可能にした。
  • COVID-19関連論文で180件以上が撤回された。これは、誤り検出の改善と、是正プロセスの迅速化の必要性を強く示している。
  • AI生成科学的テキストは、現在のところ修辞的欠陥により検出可能であるが、モデルの進化に伴い脅威が増大しており、事前の検出ツールの開発が不可欠である。
  • Problematic Paper Screenerのようなクラウドソーシングプラットフォームは、一般参加による問題論文の特定を可能にし、透明性を高めている。
  • Le Monde や FranceInfo などのマスコミ媒体を通じた連携は、研究の整合性と誤り検出に関する一般の関心を顕著に高めた。
  • 「Calling Bullshit」のシラバスの活用や博士課程教育への統合といった教育的取り組みは、科学的主張の批判的評価能力を効果的に育てている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。