Skip to main content
QUICK REVIEW

[論文レビュー] An Evaluation Protocol for Generative Conversational Systems

Seolhwa Lee, Heuiseok Lim|arXiv (Cornell University)|Oct 24, 2020
Topic Modeling参考文献 47被引用数 4
ひとこと要約

本稿では、ChatEvalプラットフォームを用いた人間によるヘッド・トゥ・ヘッドA/B二項比較を通じて、生成的対話システムのための標準化された評価プロトコルを提案する。10の最先端モデルを5つのデータセットで人間アノテーションを用いて評価し、Bradley-TerryおよびTrueSkill順位付け手法を適用することで、DialoGPTとBlenderが他のモデルを上回ることを示した。本プロトコルの実現可能性と再現可能性は、公開済みのコードおよびデータを用いて裏付けられた。

ABSTRACT

There is a multitude of novel generative models for open-domain conversational systems; however, there is no systematic evaluation of different systems. Systematic comparisons require consistency in experimental design, evaluation sets, conversational systems and their outputs, and statistical analysis. We lay out a protocol for the evaluation of conversational models using head-to-head pairwise comparison. We analyze ten recent models that claim state-of-the-art performance using a paired head-to-head performance (win-loss-tie) on five evaluation datasets. Our findings show that DialoGPT and Blender are superior systems using Bradley-Terry model and TrueSkill ranking methods. These findings demonstrate the feasibility of our protocol to evaluate conversational agents and evaluation sets. Finally, we make all code and evaluations publicly available for researchers to compare their model to other state-of-the-art dialog models.

研究の動機と目的

  • 実験的設計、評価データセット、統計的手法の不一致に起因する、生成的対話システムにおける体系的かつ一貫性のある評価の欠如に対処すること。
  • 同じデータセット、設定、統計解析を用いることで、モデル間の公平性と比較可能性を保証する再現可能な評価プロトコルを確立すること。
  • アマゾン・メカニカル・ターキュにおける人間アノテーターを用いたA/Bペアテストを通じて、最先端モデルの直接的かつヘッド・トゥ・ヘッドでの比較を可能にすること。
  • 今後の新しい対話モデルのベンチマークに役立てるために、公開可能なコードベースおよび評価フレームワークを提供すること。

提案手法

  • アマゾン・メカニカル・ターキュにおける人間アノテーターを用いて、同じ対話文脈下で二つのモデル出力を比較するChatEval A/Bペアテストフレームワークを活用する。
  • DBDC、Twitter、Cornell Movie、ESLデータセットからの単一ターンおよびマルチターン会話を含む、一貫性のある評価データセットを用いた標準化された実験設計を採用する。
  • モデルペアごとの勝利/敗北/同点スコアを計算し、相対的パフォーマンスを評価するためのメジャースコアおよびユニークスコアを算出する。
  • 二項比較からのシステム全体の順位付けを生成するために、Bradley-TerryおよびTrueSkill統計順位付けモデルを適用する。
  • モデル間のパフォーマンス差の統計的有意性を評価するために、対応t検定からのp値を用いる。
  • すべての評価データ、コード、および結果を再現可能性および今後のベンチマークのための公開に供する。

実験結果

リサーチクエスチョン

  • RQ1標準化されたヘッド・トゥ・ヘッド二項評価プロトコルは、生成的対話モデルの比較における一貫性と公平性を向上させ得るか?
  • RQ2DialoGPTやBlenderといった最先端モデルは、多様な対話データセットにおいて互いにどのように順位付けされるか?
  • RQ3勝利-敗北-同点、メジャースコア、ユニークスコアといった異なる評価指標およびBradley-Terry、TrueSkillといった統計モデルは、一貫したシステム順位付けをもたらすか?
  • RQ4本提案プロトコルは、多数のモデルに対する大規模な人間評価においてスケーラブルで費用対効果に優れているか?
  • RQ5人間評価の本質的な主観性にもかかわらず、本プロトコルはモデル間の有意義なパフォーマンス差を検出可能か?

主な発見

  • DialoGPTとBlender(2.7B)は、すべての評価データセットで最高の勝率を記録し、平均でDialoGPTが46%、Blenderが47%の比較で勝利した。
  • DBDCデータセットでは、Blender(2.7B)がDialoGPTに対して41%の勝利を記録した一方、DialoGPTは32%、同点は36%を記録し、強固なパフォーマンスの一貫性を示した。
  • Bradley-TerryモデルおよびTrueSkill順位付け手法の両方が、DialoGPTとBlenderを上位2位として順位付けしており、順位付け結果の堅牢性を確認した。
  • 重要な比較において、p値が0.05未満の統計的パワーを示した。例えば、TwitterでのDialoGPT vs. ConvAI2(seq2seq)(p=0.0)、ESLでのConvAI2(KV-MemNN) vs. ParlAI(Controllable)(p=0.01)の比較がこれに当たる。
  • ESL 3ターンデータセットにおける人間評価では、人間の出力が58–66%の比較で好まれ、人間とモデルのパフォーマンスのギャップを浮き彫りにした。
  • すべてのクラウドソーシング実験の合計コストは約1,300ドルであり、大規模な二項評価が実現可能で費用対効果に優れていることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。