Skip to main content
QUICK REVIEW

[論文レビュー] Keystroke dynamics as signal for shallow syntactic parsing

Barbara Plank|University of Groningen research database (University of Groningen / Centre for Information Technology)|Oct 11, 2016
Text Readability and Simplification参考文献 36被引用数 9
ひとこと要約

本稿では、浅層的構文解析をマルチタスク・バイリカーレンス・LSTM(bi-LSTM)モデルを用いて向上させるために、キーストローク・ダイナミクス——特に単語前の一時停止時間——を補助信号として使用することを提案する。一時停止パターンを自己ラベル化された構文的手がかりとして扱うことで、特にドメイン外データにおいて、チャンク分割とCCGスーパータグ付きの性能が顕著に向上し、言語的でない認知的信号が共同ラベル付けを要せずともNLPを向上させられることを示している。

ABSTRACT

Keystroke dynamics have been extensively used in psycholinguistic and writing research to gain insights into cognitive processing. But do keystroke logs contain actual signal that can be used to learn better natural language processing models? We postulate that keystroke dynamics contain information about syntactic structure that can inform shallow syntactic parsing. To test this hypothesis, we explore labels derived from keystroke logs as auxiliary task in a multi-task bidirectional Long Short-Term Memory (bi-LSTM). Our results show promising results on two shallow syntactic parsing tasks, chunking and CCG supertagging. Our model is simple, has the advantage that data can come from distinct sources, and produces models that are significantly better than models trained on the text annotations alone.

研究の動機と目的

  • キーストローク・ログデータ——心理言語学で一般的に用いられるもの——に、NLPに有用な潜在的な構文的信号が含まれるかどうかを調査すること。
  • テキストとキーストローク・データの共同ラベル付けを必要とせずに、キーストローク・ダイナミクスをシーケンス・モデリングにおける補助タスクとして活用する手法を開発すること。
  • このような補助信号が、チャンク分割やCCGスーパータグ付きといった浅層的構文解析タスクの性能を向上させるかどうかを評価すること。
  • 低リソースまたはドメイン外の設定において、低コストで侵襲性のない認知的サイド・シグナルを用いてNLPモデルを向上させる可能性を検討すること。

提案手法

  • キーストローク・ログから単語前の一時停止時間の抽出を行い、個々のユーザーごとに中央値と四分位範囲を用いて正規化することで、個人差を補正する。
  • ユーザーごとの統計を用いて一時停止時間を自己生成されたラベルに離散化し、構文的構造のシーケンス・ラベル付けタスクを構築する。
  • マルチタスク・バイリカーレンス・Long Short-Term Memory(bi-LSTM)ネットワークが、浅層的構文解析(チャンク分割とCCGスーパータグ付き)とキーストロークに基づく一時停止ラベル付けタスクを同時に学習する。
  • 構文的タスクと補助タスクの間で共有層を持つことで、エンド・ツー・エンドで訓練し、キーストロークのパターンから構文予測への知識移行を可能にする。
  • テキストは1つのソースから、キーストローク・データは別のソースから取得できるため、テキストとキーストロークが対応付けられたコーパスを必要としない。
  • 2つのデータセット(チャンク分割用とCCGスーパータグ付き用)を用いてモデルを評価し、テキストのみのベースラインと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1キーストローク・ダイナミクス、特に単語前の一時停止時間は、自然言語処理における構文的構造の信頼できる代理指標として機能するか?
  • RQ2キーストロークに基づく補助信号を組み込むことで、チャンク分割やCCGスーパータグ付きといった浅層的構文解析タスクの性能が向上するか?
  • RQ3キーストローク・データは、ドメイン外またはリソースが限られたデータ設定において、どの程度モデルの性能を向上させるか?
  • RQ4名詞句(NP)、動詞句(VP)、前置詞句(PP)といった異なる構文的成分において、モデルの性能はどのように変動するか?

主な発見

  • マルチタスク・bi-LSTM モデルは、チャンク分割とCCGスーパータグ付きの両タスクで、テキストのみのベースラインを顕著に上回り、キーストローク・データが補助信号として有効であることを示している。
  • 特に名詞句(NP)やSNSのテキストに見られるような断片的・標準でない形(例:'bithcy' が 'bitchy' の意味)において、改善が顕著に見られる。
  • ドメイン外データにおいても顕著な向上が得られ、キーストローク信号が書き方のスタイルやドメインの違いを越えて一般化を助けることが示唆されている。
  • 前置詞(PP)の直前の一時停止では、一時停止時間の短さとチャンク境界とのずれにより、改善が弱く、形態句的構文的特徴を捉える制限があることが示唆されている。
  • 品詞タグ付きのタスクでは性能が低く、キーストローク・データが品詞カテゴリーよりも構文的構造の情報をより効果的に捉えていることが示唆されている。
  • 最小限のキーストローク・データでもモデルが頑健に機能し、少量のタイピング行動データでも構文解析の性能向上が顕著に得られることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。