Skip to main content
QUICK REVIEW

[論文レビュー] SynthBio: A Case Study in Human-AI Collaborative Curation of Text Datasets

Ann Yuan, Daphne Ippolito|arXiv (Cornell University)|Nov 11, 2021
Topic Modeling参考文献 55被引用数 8
ひとこと要約

本論文では、大規模言語モデル(LLM)を用いて種まきとしての人物伝記を生成し、その後人間のレビュアーがそれを編集するという、人間とAIが協働する新しい手法であるSynthBioを紹介する。この手法により、4,692件の架空の伝記からなる高品質でノイズの少ないデータセットが作成された。このデータセットは性別や国籍にわたるバランスが良く、出典属性への忠実度が高く、現実世界のデータよりもやや不自然な文体であるため、記憶の再現に依存しない文書生成の評価に向けたきびしいベンチマークとして有効である。

ABSTRACT

NLP researchers need more, higher-quality text datasets. Human-labeled datasets are expensive to collect, while datasets collected via automatic retrieval from the web such as WikiBio are noisy and can include undesired biases. Moreover, data sourced from the web is often included in datasets used to pretrain models, leading to inadvertent cross-contamination of training and test sets. In this work we introduce a novel method for efficient dataset curation: we use a large language model to provide seed generations to human raters, thereby changing dataset authoring from a writing task to an editing task. We use our method to curate SynthBio - a new evaluation set for WikiBio - composed of structured attribute lists describing fictional individuals, mapped to natural language biographies. We show that our dataset of fictional biographies is less noisy than WikiBio, and also more balanced with respect to gender and nationality.

研究の動機と目的

  • 自然言語生成タスクのための高品質でノイズの少ないテキストデータセットの不足を解消すること。
  • 事前学習済みモデルからのデータ汚染リスクを低減するため、現実世界の知識を記憶しない合成ベンチマークを構築すること。
  • 性別、国籍、著名度の種類などの代表的属性のバランスを意図的に制御することで、評価データセットにおける人種的・文化的な偏りを是正すること。
  • 人間による執筆から人間による編集へとシフトする、スケーラブルで効率的なデータ収集パイプラインを構築すること。
  • 実際のデータセットで学習したモデルが、より多様で制御された分布に一般化するかどうかを評価すること。

提案手法

  • 構造化されたインフォボックス(架空の人物を記述)をもとに、大規模言語モデル(LLM)を用いて初期の伝記ドラフトを生成する。
  • 人間のレビュアーがLLMが生成した伝記を編集・改善することで、完全な執筆から部分的な修正への負担を軽減する。
  • 性別、国籍、職業などの属性を制御することで、社会的アイデンティティにわたるバランスの取れた表現を確保する。
  • 厳密な品質管理を実施:レビュアーには2分以内に修正できない伝記は破棄するよう指示され、極端なケースは著者らが再レビューした。
  • まず著名度の種別を決定し、次にスキーマから属性をサンプリングし、最後にLLMを用いてテキストを生成・精錬するというパイプラインでデータセットを構築する。
  • 最終データセットの文のなめらかさと語彙の多様性を測定するために、GPT-2のパープレキシティと語彙多様性(Div-2)を用いる。

実験結果

リサーチクエスチョン

  • RQ1LLMが生成する種まきを用いた人間とAIの協働により、高品質なテキストデータセットの収集にかかる時間とコストを著しく削減できるか?
  • RQ2属性が制御された合成データセットは、現実世界のデータセットと比較して、よりバランスが取れており、バイアスの少ない評価結果をもたらすか?
  • RQ3WikiBioなどの実データセットで微調整したモデルが、SynthBioのような合成的でよりバランスの取れたベンチマークに一般化する程度はどの程度か?
  • RQ4実データセットと比較して、合成データセットにおける生成された伝記のインフォボックスへの忠実度はどの程度か?
  • RQ5特に非西洋的アイデンティティの表現に関して、合成データにどのような公平性の問題が生じるか?

主な発見

  • SynthBioは、2,249件の架空のインフォボックスを4,692件の伝記にマッピングしており、1インフォボックスあたり平均2.1件の伝記が対応しており、実データセットと比較して著しく冗長性が低減されている。
  • 最終データセットでは、性別を問わない代名詞(they/them)が16.2%にのぼり、元のWikiBioの2%と比較して、より包括的であることが示された。
  • SynthBioの伝記はGPT-2パープレキシティ112.0(低い値がよりなめらか)であり、WikiBioの97.7と比較してわずかに文のなめらかさが低いが、出典属性への忠実度は高い。
  • 人間による評価では、SynthBioの伝記はWikiBioよりもインフォボックスへの忠実度が高く、文のなめらかさは同等であることが確認された。
  • WikiBioで微調整したモデルはSynthBioでは著しく性能を発揮しなく、SynthBioがより困難で分布外の一般化を評価するベンチマークを捉えていることが示された。
  • データセットには公平性の懸念が生じており、特に非二元的性別の個人に対する代名詞の使い方が一貫していないこと、また意図に反して西洋の機関や国籍が過剰に代表されていることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。