Skip to main content
QUICK REVIEW

[論文レビュー] ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time

Shangqing Tu, Chunyang Li|arXiv (Cornell University)|Apr 27, 2023
Topic Modeling被引用数 7
ひとこと要約

本稿では、21のベンチマークを対象に、ChatGPTの応答を時間経過とともに継続的に記録したChatLogというデータセットを紹介する。包括的な評価と特徴量分析を通じて、モデル行動の時間的変化を明らかにし、新しいChatGPTバージョンの検出に耐性を高める安定した言語的および知識的特徴を同定した。

ABSTRACT

ChatGPT has achieved great success and can be considered to have acquired an infrastructural status. There are abundant works for evaluating ChatGPT on benchmarks. However, existing benchmarks encounter two challenges: (1) Disregard for periodical evaluation and (2) Lack of fine-grained features. In this paper, we construct ChatLog, an ever-updating dataset with large-scale records of diverse long-form ChatGPT responses for 21 NLP benchmarks from March, 2023 to now. We conduct a comprehensive performance evaluation to find that most capabilities of ChatGPT improve over time except for some abilities, and there exists a step-wise evolving pattern of ChatGPT. We further analyze the inherent characteristics of ChatGPT by extracting the knowledge and linguistic features. We find some stable features that stay unchanged and apply them on the detection of ChatGPT-generated texts to improve the robustness of cross-version detection. We will continuously maintain our project at \url{https://github.com/THU-KEG/ChatLog/}.

研究の動機と目的

  • ChatGPTの行動が継続的なトレーニングやアライメント更新の影響を受けて、時間経過とともにどのように変化するかを体系的に調査すること。
  • 単一の時点や限定的なバージョン比較に焦点を当てた既存の評価におけるギャップを埋めること。
  • モデル出力の粗い(月次)および細かい(日次)変化を捉える縦断的データセットを構築すること。
  • 時間経過に伴い安定しているか、変化する内在的特徴(言語的および知識ベース)を抽出・分析すること。
  • 時間的変化にわたる安定した特徴を活用することで、新しいChatGPTバージョンの検出モデルの耐性を高めること。

提案手法

  • 時間的変化を捉えるための二重データセット構成を採用:ChatLog-Monthly(月間38,730対のQAペア)およびChatLog-Daily(1日1,000件の同一ELI5質問)を用意。
  • 生成および分類タスクを含む21のベンチマークで自動的および人的な評価を実施し、パフォーマンスの進化を追跡。
  • 情報抽出や言語分析などのNLPツールを用いて、モデル出力から10の知識特徴量と255の言語的特徴量を抽出。
  • 3つの分析を実施:時間的変化における特徴スコアのトレンド分析、ピアソン相関を用いたパフォーマンス相関分析、および安定特徴の同定のための変動分析。
  • HC3データ上でRoBERTaベースの検出器を訓練し、LightGBMを用いてRoBERTaの確率と安定特徴をアンサンブル化することで、一般化性能の向上を図った。
  • GitHub上での継続的モニタリングとデータセットの更新を通じて、長期的な時間的カバレッジと再現可能性を確保。
Figure 1: An example of different periods’ ChatGPT answers for the same question sampled from ELI5 dataset. Later version uses a metaphor for explanation.
Figure 1: An example of different periods’ ChatGPT answers for the same question sampled from ELI5 dataset. Later version uses a metaphor for explanation.

実験結果

リサーチクエスチョン

  • RQ1ChatGPTのパフォーマンスは、多様なNLPタスクにおいて時間経過とともにどのように変化するか?
  • RQ2ChatGPTの出力の内在的特徴のうち、どの特徴がモデル更新に伴い安定しているか、または顕著に変化するか?
  • RQ3時間経過に伴い、言語的および知識ベースの特徴は、ベンチマークパフォーマンスとどの程度相関するか?
  • RQ4歴史的出力から抽出した安定特徴は、新しいChatGPTバージョンの検出モデルの耐性を向上させることができるか?
  • RQ5事前学習モデルベースの検出器(例:RoBERTa)およびルールベース分類器(例:GLTR、パーセプキティ)は、進化を続けるモデル出力に対してどの程度の性能を示すか?

主な発見

  • 2023年3月から4月にかけて、ChatGPTの応答は顕著に進化しており、後続バージョンでは「5歳に説明する」タスクに対してより自然で隠喩的な説明を提供していた。
  • RoBERTaベースの検出器は、2023年1月のデータに対しては90%の精度を示したが、2023年4月のデータに対しては最大10%のパフォーマンス低下を示し、モデル更新に起因する分布シフトを示唆した。
  • RoBERTa-qaモデルは質問文の文脈を活用することで高い精度を達成したが、回答文のみを入力とした場合、性能は90%に低下し、質問情報への依存が顕著に現れた。
  • GLTRやパーセプキティベース分類器は、微調整済みRoBERTaモデルと比較してより大きなパフォーマンス低下を示し、事前学習モデルの時間的シフトに強い一般化能力を示した。
  • 低変動係数を用いて同定された安定特徴は、ベンチマークパフォーマンスと強く相関しており、RoBERTaと組み合わせることで検出の耐性が向上した。
  • RoBERTaの確率と10の安定特徴を統合したアンサンブル検出器は、単体のモデルよりも新しいChatGPTバージョンへの一般化性能が優れていた。
Figure 2: Trend of ChatGPT’s performance Rouge scores on ChatLog-Daily dataset every day from March 5 to April 9, 2023. Note that the data at the start point of January 18 comes from open-access HC3 dataset.
Figure 2: Trend of ChatGPT’s performance Rouge scores on ChatLog-Daily dataset every day from March 5 to April 9, 2023. Note that the data at the start point of January 18 comes from open-access HC3 dataset.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。