Skip to main content
QUICK REVIEW

[論文レビュー] Label-Agnostic Sequence Labeling by Copying Nearest Neighbors

Sam Wiseman, Karl Stratos|arXiv (Cornell University)|Jun 10, 2019
Topic Modeling参考文献 31被引用数 5
ひとこと要約

この論文は、類似度ベースの検索フレームワーク内で、最近傍のトークンレベルのラベルをコピーするラベルに依存しない系列ラベリング手法を提案する。予測とラベル固有の表現を分離することで、再訓練なしに細粒度ラベリングタスクで強力なゼロショット転移性能を達成する。さらに、動的計画法によるデコード戦略により、異なるコピー元セグメントの数を最小化することで、精度と解釈可能性が向上する。

ABSTRACT

Retrieve-and-edit based approaches to structured prediction, where structures associated with retrieved neighbors are edited to form new structures, have recently attracted increased interest. However, much recent work merely conditions on retrieved structures (e.g., in a sequence-to-sequence framework), rather than explicitly manipulating them. We show we can perform accurate sequence labeling by explicitly (and only) copying labels from retrieved neighbors. Moreover, because this copying is label-agnostic, we can achieve impressive performance when transferring to new sequence-labeling tasks without retraining. We additionally consider a dynamic programming approach to sequence labeling in the presence of retrieved neighbors, which allows for controlling the number of distinct (copied) segments used to form a prediction, and leads to both more interpretable and accurate predictions.

研究の動機と目的

  • 転移学習と解釈可能性におけるラベル依存型の retrieve-and-edit モデルの限界を解消すること。
  • ラベルタイプに依存しない系列ラベリングアプローチを構築し、再訓練なしに新しいタスクにゼロショット転移を可能にすること。
  • 取得した近傍からの異なるコピー元セグメントの数を制御することで、予測の解釈可能性と精度を向上させること。
  • 系列生成に依存せず、最近傍からのラベルコピーのみを用いて効果的な系列ラベリングを実現すること。

提案手法

  • モデルは、BERTベースの文埋め込みなどの学習済み類似度関数を用いて、学習データベースからM個の最近傍を検索する。
  • 各入力トークンについて、検索された近傍の系列内での類似度が最も高いトークンのラベルをコピーすることでラベルを予測する。
  • 予測が入力の類似度にのみ依存するため、ラベルタイプやラベル固有のパrameterに依存しない。この性質により、本手法は本質的にラベルに依存しない。
  • 異なるコピー元セグメントの数を最小化しつつ予測の信頼性をバランスさせるために、動的計画法によるデコード戦略を導入する。
  • デコードの目的関数は、ハイパーパrameter cで重み付けされたセグメント数と予想される誤ラベリングコストの両方を組み合わせており、コンactで解釈可能な予測を促進する。
  • 本手法は、テスト時に近傍を検索可能な任意のモデルに適用可能であり、標準的な系列ラベラーに対しても適用可能である。

実験結果

リサーチクエスチョン

  • RQ1ラベル固有の表現を学習せずに、最近傍からのラベルコピーのみを用いて、競争力のある性能を達成できるか?
  • RQ2標準的なラベル依存型モデルと比較して、ラベルに依存しないコピー戦略は、新しいラベリングタスクへのゼロショット転移でどのように性能を発揮するか?
  • RQ3動的計画法によるデコード戦略は、異なるコピー元セグメントの数を減らすことで、精度と解釈可能性の両方を向上させられるか?
  • RQ4セグメント数を最小化することで、系列ラベリングにおける一般化性能やロバストネスが向上するか?
  • RQ5本手法は、類似度ベースの検索に、BERTのような事前学習表現を効果的に活用できるか?

主な発見

  • 最適な動的計画法デコードを用いることで、CoNLL 2003 NER テストセットで90.20のF1スコアを達成し、それ以外の設定(90.20)では89.94 F1に上昇する。
  • ゼロショット転移設定では、c=0.5で動的計画法デコードを適用することで、F1スコアが71.74から73.61に向上する。
  • 微調整なしに、標準的な系列ラベリングタスク(例:CoNLL 2003で89.94 F1)で強い性能を維持する。特に、異なるタスクで学習した場合でも同様の性能を発揮する。
  • 平均して、1例あたり約1.5の異なるコピー元セグメントしか使用せず、高いコンパクト性と解釈可能性を示している。
  • 特に粗いラベルから細かいラベルへの転移において、強力なベースラインを著しく上回る性能を発揮する。
  • 動的計画法アプローチにより、予測の信頼性とセグメント数の間で制御可能なトレードオフが可能となり、cの値を大きくすることで性能が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。