[論文レビュー] Language models are better than humans at next-token prediction
本研究では、OpenWebTextデータセットを用いて、人間と言語モデルの次トークン予測性能を直接比較し、トップ1正解率とパープレキシティの両方を測定した。その結果、GPT-3-Adaのような小規模言語モデルですら、両指標において人間を上回っていることが判明し、現在の言語モデルが学習対象のタスク、すなわち次トークン予測においてすでに人間を上回っていることを示している。
Current language models are considered to have sub-human capabilities at natural language tasks like question-answering or writing code. However, language models are not trained to perform well at these tasks, they are trained to accurately predict the next token given previous tokes in tokenized text. It is not clear whether language models are better or worse than humans at next token prediction. To try to answer this question, we performed two distinct experiments to directly compare humans and language models on this front: one measuring top-1 accuracy and the other measuring perplexity. In both experiments, we find humans to be consistently \emph{worse} than even relatively small language models like GPT3-Ada at next-token prediction.
研究の動機と目的
- 言語モデルが次トークン予測という学習の核となるタスクで人間を上回っているかどうかという曖昧さを解消すること。
- 洗練された手作業によるデータではなく、非手作業的で現実世界のインターネットテキスト(OpenWebText)を用いた、同等の比較を実施すること。
- トップ1正解率に加えて、次トークンの確率分布全体を捉えるパープレキシティを測定することで、人間の性能を評価すること。
- 過去の主張、特に誤った外挿や間接的推定手法に依存するもので、人間のパープレキシティが言語モデルより低いとされる主張に反論すること。
提案手法
- 参加者にOpenWebTextのシーケンスから50,000語の語彙の中から最も可能性の高い次トークンを選択してもらうトップ1正解率実験を実施した。
- 確率の比率を割り当てることで、参加者が候補トークン間の確率比を評価するようにする、校正済みの確率推定ゲームを開発した。
- GPT-2-smallを基準モデルとして用い、比率ベースのスコアリング方式により人間のパープレキシティを推定し、言語モデルと直接比較できるようにした。
- 不確実性推定技術を適用して、校正の問題による過小評価の可能性を踏まえ、人間のパープレキシティ推定の信頼性を評価した。
- 人間と言語モデルの両者に対して同一の手法を適用することで、パープレキシティスコアの公平かつ直接的な比較を実現した。
- GPT-3-Ada、GPT-2、GPT-1を含む複数の言語モデルを評価し、報告された対数尤度確率を用いてパープレキシティを計算した。
実験結果
リサーチクエスチョン
- RQ1現実世界のインターネットテキスト上で、言語モデルは人間を上回って次トークン予測を行うのか?
- RQ2人間の真のパープレキシティは何か? そしてそれは小規模言語モデルのそれと比べてどうなるか?
- RQ3特に小規模モデルからの外挿や主観的尺度に基づく推定に依存する、過去のパープレキシティ推定はどれほど信頼できるのか?
- RQ4トップ1正解率だけでは次トークン予測性能を十分に測定できるのか? それとも、確率分布全体のモデリングが不可欠なのか?
- RQ5言語モデルがこのタスクに特化して学習されている以上、人間をどれほど上回っているのか? すなわち、次トークン予測という特定のタスクにおいて。
主な発見
- 人間はOpenWebTextデータセットで約28%のトップ1正解率を達成したが、これは類似の設定下でGPT-2が達成した36%の正解率より低い。
- GPT-3-Adaのような小規模言語モデルですら、トップ1正解率とパープレキシティの両方で人間を上回っており、学習の核となる目的である次トークン予測において、すでに超人的な性能を示している。
- 人間のパープレキシティ推定値はGPT-3-Adaのそれよりも著しく高く、確率報告の校正が不十分なために人間のパープレキシティが過大評価されていた。
- 本研究では、校正済みの確率推定において、人間の性能が2層のニューラルネットワークよりも劣っていることが判明し、このタスクにおける人間の確率的推論の根本的な限界を示唆している。
- 人間のパープレキシティが約12であるという過去の主張は、小規模モデルからの誤った外挿と非代表的なデータセットに起因するため、無効である。
- 結果として、現代の言語モデルは、小規模モデルの段階でもすでに次トークン予測において超人的な性能を示しており、解釈可能性やモデル能力に関する重要な示唆を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。