Skip to main content
QUICK REVIEW

[論文レビュー] Embedded HuffPost New Category Dataset

Rishabh Misra, Misra, Rishabh|arXiv (Cornell University)|Sep 23, 2022
Topic Modeling被引用数 10
ひとこと要約

本論文は、2012年から2022年までの期間にわたり、210,294件のHuffPostニュース見出しを含む大規模かつ高品質なニュースカテゴリーデータセットを紹介している。このデータセットには、細分化されたカテゴリーラベル、公開日、メタデータが含まれており、自然言語処理研究における意味的タグ付け、皮肉検出、バイアス分析を可能にしている。BERTベースのモデルを用いた疫学的テキスト分類やマスコミ言語分析など、幅広く活用されている。

ABSTRACT

People rely on news to know what is happening around the world and inform their daily lives. In today's world, when the proliferation of fake news is rampant, having a large-scale and high-quality source of authentic news articles with the published category information is valuable to learning authentic news' Natural Language syntax and semantics. As part of this work, we present a News Category Dataset that contains around 210k news headlines from the year 2012 to 2022 obtained from HuffPost, along with useful metadata to enable various NLP tasks. In this paper, we also produce some novel insights from the dataset and describe various existing and potential applications of our dataset.

研究の動機と目的

  • 自然言語処理研究を目的として、細分化されたカテゴリーラベルとメタデータを備えた大規模かつ高品質なニュースデータセットの構築。
  • 時間経過に伴うジャーナリズムの傾向やマスコミの注目分野の変化を分析可能にする。
  • 意味的タグ付け、固有表現認識、語義の意味あいまいさ解消といった自然言語処理タスクを支援する。
  • さまざまなニュースカテゴリを通じて言語的パターンや意味構造を研究するためのベンチマークを提供する。
  • 性別表現や警察殺害報道における言語使用を含む、マスコミバイアスに関する研究を促進する。

提案手法

  • BeautifulSoupおよびSeleniumを用いて、HuffPostのアーカイブ済みWebページからニュース見出しを収集する。
  • カテゴリ、見出し、著者、公開日、要約、記事リンクなど、構造化されたメタデータを抽出する。
  • データ品質と一貫性を確保するため、1,000件未満の記事を有するカテゴリを除外した。
  • 本物のニュースとTheOnionの皮肉的な見出しを組み合わせることで、注釈付きのハイブリッドニューラルネットワークと注目メカニズムを用いて皮肉検出を実施した。
  • BERTベースのモデルを適用し、犯罪関連のニュースにおけるマスコミ言語のパターンを特定した。特に受動態や名詞化に注目した。
  • 疾患関連の内容とフィルタリング済みの疫学的でないニュースを垂直統合し、疫学的テキスト分類のためのデータセットを構築した。

実験結果

リサーチクエスチョン

  • RQ1語いの選択や文構造といった言語的特徴は、ニュースカテゴリごとにどのように異なるか?
  • RQ2ニュースカテゴリーメタデータは、皮肉検出や意味的タグ付けといったタスクにおけるNLPモデルの性能向上にどの程度寄与するか?
  • RQ32012年から2022年の間に、ジャーナリズムの注目分野はどのように変化したか?
  • RQ4マスコミ報道が警察殺害報道において責任を曇らせるためにどのような文構造を用いているか?
  • RQ5異なるカテゴリにおいて、ニュース見出しや要約に、内面的および明示的な性別バイアスはどのように現れるか?

主な発見

  • データセットには42のカテゴリにまたがる210,294件のニュース見出しが含まれており、その中で最も頻出するのは政治(35,602件)とウェルネス(17,945件)である。
  • データ品質を維持するため、1,000件未満の記事を有するカテゴリを除外した。その結果、高カバレッジのトピックに特化した洗練されたデータセットが得られた。
  • このデータセットとTheOnionを統合して作成されたニュース見出し皮肉データセットは、Twitterベースの皮肉データセットと比較して、ラベルノイズが低く、ラベル密度が高かった。
  • BERTベースの分析から、警察殺害報道におけるマスコミ報道は、一般の市民殺害報道と比較して、受動態、名詞化、不及物動詞をより多く用いていることが判明。これは責任を曇らせる可能性がある。
  • 性別表現の分析から、語いの選択、コンテンツ、ラベル付けにおいて、社会的構築されたバイアスの明確な証拠が得られた。
  • 疾患関連の内容を除外し、関連するニュースと統合することで、本データセットを活用して高品質な疫学的テキスト分類データセットを構築した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。