[論文レビュー] A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing
本研究では、ノーベル賞受賞小説に登場するイグナティウス・J・レイリーと、古生代にさかのぼる生物のパンダクトイルの間の壮大な戦いをテーマに、12体の最新のインstructチューニング済みLLMと人間の作家を、ゼロショットの創造的ライティングにおいて評価した。最先端の商用LLMは、流れやすさ、一貫性、スタイルの面で人間の性能と同等またはわずかに上回ったが、オリジナリティやユーモアの面では人間が優位にあり、これはモデルがユーモラスな要素を処理する際に二元的(バイナリ)な分岐を示していることを示している。
We evaluate a range of recent LLMs on English creative writing, a challenging and complex task that requires imagination, coherence, and style. We use a difficult, open-ended scenario chosen to avoid training data reuse: an epic narration of a single combat between Ignatius J. Reilly, the protagonist of the Pulitzer Prize-winning novel A Confederacy of Dunces (1980), and a pterodactyl, a prehistoric flying reptile. We ask several LLMs and humans to write such a story and conduct a human evalution involving various criteria such as fluency, coherence, originality, humor, and style. Our results show that some state-of-the-art commercial LLMs match or slightly outperform our writers in most dimensions; whereas open-source LLMs lag behind. Humans retain an edge in creativity, while humor shows a binary divide between LLMs that can handle it comparably to humans and those that fail at it. We discuss the implications and limitations of our study and suggest directions for future research.
研究の動機と目的
- 最新のインストラクションチューニング済みLLMのゼロショットでオープンエンドな文脈における創造的ライティング能力を評価すること。
- 複数の次元にわたって人間の評価を用いて、LLMの性能を人間の作家と直接比較すること。
- トレーニングデータへの漏洩を最小限に抑えるために、トレーニングデータに存在する可能性が低い、独自で重複のない物語設定を選択すること。
- 現在のLLMの創造的ライティングにおける強みと限界、特にユーモアとオリジナリティの面での特徴を特定すること。
- 創造的ストーリーテリングの評価ベンチマークにおける空白を埋めるために、人間による評価を含む包括的な評価を提供すること。
提案手法
- 独自で新規の物語プロンプトを考案:ピューリッジャー賞受賞小説に登場するイグナティウス・J・レイリーと、古生代の生物であるパンダクトイルの単独戦闘。
- 12体の最新のインストラクションチューニング済みLLMと人間の作家が、微調整やコンテキスト学習なしに同一のゼロショット条件で物語を生成した。
- 人間による評価は、創造的ライティング基準に適合したレーティング基準を用い、流れやすさ、一貫性、オリジナリティ、ユーモア、スタイルを評価した。
- レーティング担当者は各物語を10の基準について1〜5段階のスケールで評価し、全体のスコアをボックスプロットと統計的要約を用いて集約・分析した。
- LLMのトレーニングデータへの再利用を避けるために、LLMのトレーニングデータセットで露出の可能性が低いシナリオを選択した。
- 評価結果を分析し、モデルの性能を人間のベンチマークと比較し、特にユーモアと創造性における質的差異に焦点を当てた。

実験結果
リサーチクエスチョン
- RQ1最先端のインストラクションチューニング済みLLMは、ゼロショットの創造的ライティングにおいて人間の作家と比べてどの程度のパフォーマンスを示すか?
- RQ2LLMは、流れやすさ、一貫性、オリジナリティ、ユーモア、スタイルといった創造的ライティングの主要次元で、人間のパフォーマンスをどの程度再現できるか?
- RQ3現在のLLMは、人間と比較して、ユーモアやオリジナリティに富んだ物語的コンテンツを生成する際に、どのような限界を示しているか?
- RQ4ゼロショット条件下で、商用LLMはオープンソースモデルを上回るパフォーマンスを示すか?
- RQ5自動化されたメトリクスが不十分な場合、人間による評価は、LLMが生成する創造的ライティングの質を評価する上で、どのような役割を果たすか?
主な発見
- 商用SOTA LLMは、流れやすさ、一貫性、スタイルの面で人間の作家と同等またはわずかに上回った。全体のスコアは人間のパフォーマンスと密接に分布していた。
- オリジナリティの面では人間が明確な優位性を示しており、LLMが生成した物語はより形式的・反復的な物語構造を示した。
- ユーモアのパフォーマンスには二元的分岐が見られた:一部のLLMは効果的にユーモアを生成したが、他はまったく失敗しており、これは一貫性のないユーモラスな推論を示している。
- オープンソースLLMは、全評価次元において商用モデルに比べて一貫して低いパフォーマンスを示した。
- 最も低いスコアを記録した物語(Alpacaが生成)は、全体のレーティングで14/100であった。オリジナリティやユーモアといった主要基準で、複数の項目が1または2の低スコアを記録していた。
- 高い流れやすさと一貫性にもかかわらず、多くのLLMは、特に複雑または風変わりなシナリオにおいて、物語の緊張感やテーマの深さを維持できなかった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。