Skip to main content
QUICK REVIEW

[論文レビュー] Applying Deep Belief Networks to Word Sense Disambiguation

Peratham Wiriyathammabhum, Boonserm Kijsirikul|arXiv (Cornell University)|Jul 2, 2012
Topic Modeling参考文献 19被引用数 12
ひとこと要約

この論文は、SENSEVAL-2データセットを用いて、深層学習生成モデルであるディープベルーフネットワーク(DBN)をワードセンスの意味あいまいさ解消(WSD)に適用している。DBNは制限付きボルツマンマシン(RBM)を用いたグリーディな事前学習と微調整を活用し、スパースで高次元のWSDデータから意味のある階層的特徴を抽出することで、SVM、MaxEnt、ナイーブベイズ、KPCAといった最先端の浅い学習アルゴリズムを上回り、結合特徴において最高のマイクロ平均リCALL 61.30%を達成した。

ABSTRACT

In this paper, we applied a novel learning algorithm, namely, Deep Belief Networks (DBN) to word sense disambiguation (WSD). DBN is a probabilistic generative model composed of multiple layers of hidden units. DBN uses Restricted Boltzmann Machine (RBM) to greedily train layer by layer as a pretraining. Then, a separate fine tuning step is employed to improve the discriminative power. We compared DBN with various state-of-the-art supervised learning algorithms in WSD such as Support Vector Machine (SVM), Maximum Entropy model (MaxEnt), Naive Bayes classifier (NB) and Kernel Principal Component Analysis (KPCA). We used all words in the given paragraph, surrounding context words and part-of-speech of surrounding words as our knowledge sources. We conducted our experiment on the SENSEVAL-2 data set. We observed that DBN outperformed all other learning algorithms.

研究の動機と目的

  • ディープベルーフネットワーク(DBN)が、既存の浅い学習アルゴリズムと比較して、ワードセンスの意味あいまいさ解消(WSD)において効果的であるかどうかを評価すること。
  • 深層学習が、豊富な手作業による特徴工学を伴わずに、スパースで高次元のWSDデータから意味のある階層的特徴を抽出できるかどうかを調査すること。
  • 各語の意味の種類ごとに限られた学習インスタンスしか得られない状況でも、DBNが十分に一般化できるかどうかを特定すること。
  • トピック的、局所的、品詞特徴といった異なる知識源におけるDBNの性能を比較すること。

提案手法

  • DBNは2段階のプロセスで訓練される:まず制限付きボルツマンマシン(RBM)を用いた階層的グリーディな事前学習を行い、その後判別的バックプロパゲーションによる微調整を行う。
  • 特徴ベクトルは、周辺語、品詞タグ、語の意味から構築され、SENSEVAL-2の英語の語彙的サンプルタスクを用いる。
  • モデルは複数層の確率的隠れユニットを備えた深層アーキテクチャを用い、文脈の階層的表現を学習する。
  • 交差検証を用いて、学習率やネットワークの深さといった最適なハイパーパrameterを特定する。特に、小規模な学習セットに対して重点を置く。
  • 性能評価は、複数の語のタスクにおけるSENSEVAL-2テストセット上でマイクロ平均リCALLを用いて行う。
  • ベースラインモデルには1-NN、ナイーブベイズ、SVM、MaxEnt、KPCA、MLPが含まれ、p値を用いて結果を比較する。

実験結果

リサーチクエスチョン

  • RQ1ディープベルーフネットワーク(DBN)は、SVM や MaxEnt といった従来の浅い学習モデルよりも、ワードセンスの意味あいまいさ解消において優れた性能を示せるか?
  • RQ2局所的文脈と品詞タグから得られるスパースで高次元の特徴を用いてDBNを学習した場合、その性能はいかがなものか?
  • RQ3トピック的または品詞特徴を追加せずに、局所的特徴のみを用いた場合でも、DBNは優れた性能を維持できるか?
  • RQ4従来の分類器と比較して、DBNはWSDにおいて、手作業による特徴工学の必要性をどの程度低減できるか?

主な発見

  • DBNは結合特徴セットにおいて、最高のマイクロ平均リCALL 61.30%を達成し、ベースラインおよび他のすべての浅いモデルを顕著に上回った。
  • 局所的特徴設定では、DBNはベースラインを13.63%、ロジスティック回帰を3.97%、Linear SVMを2.73%上回った。
  • 品詞特徴設定では、Linear SVMを8.13%、ロジスティック回帰を5.21%上回り、この特徴タイプにおいても優れた性能を示した。
  • トピック的特徴では、DBNは57.25%のマイクロ平均リCALLを達成し、ベースラインを13.70%上回り、他のモデルと比べ顕著に優れた性能を示した。
  • 高次元性とスパarsityにもかかわらず、DBNは1語のタスクあたり75~300件のインスタンスしか得られない状況でも良好に一般化しており、データ不足に対して強いロバストネスを示した。
  • 結果から、DBNは生の文脈特徴から有用な非線形表現を抽出でき、手作業による特徴の設計に依存する必要性を低減できることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。