QUICK REVIEW
[論文レビュー] Learning Pairwise Disjoint Simple Languages from Positive Examples
Alexis Linard, Rick Smetsers|arXiv (Cornell University)|Jun 6, 2017
Algorithms and Data Compression参考文献 6被引用数 3
ひとこと要約
本稿では、正例のみを用いて、ペアワイズに不交差な単純な正則言語を学習する2つの圧縮ベースのクラスタリング手法を提案する。ポンピング補題の分解とトレーランスリピートを活用して、共通する構造的パターンを持つ文字列をグループ化する。本手法は産業用プリンタのデータにおいて、明確な印刷ジョブパターンを同定し、現実世界の文脈における言語発見の実用的応用を示している。
ABSTRACT
A classical problem in grammatical inference is to identify a deterministic finite automaton (DFA) from a set of positive and negative examples. In this paper, we address the related - yet seemingly novel - problem of identifying a set of DFAs from examples that belong to different unknown simple regular languages. We propose two methods based on compression for clustering the observed positive examples. We apply our methods to a set of print jobs submitted to large industrial printers.
研究の動機と目的
- 正例のみが利用可能で負例が存在しない状況において、複数の不交差な正則言語を学習する課題に対処すること。
- 繰り返しパターンやトレーランスリピートなどの、異なる単純な正則言語に属する文字列の背後にある構造的パターンを同定すること。
- 同じポンピング分解を共有する文字列をクラスタリングすることで、事前のラベルなしに言語を推論可能にするクラスタリング手法を開発すること。
- 大規模プリンタの印刷ジョブデータ—各ジョブが別個の単純な言語カテゴリに属する—に本手法を適用すること。
- 23,000件以上の印刷ジョブから成るデータセット上で本手法を検証し、(ab)+、(abc)+、a(bc)+aなどの言語パターンの有効な回復が可能であることを示すこと。
提案手法
- ポンピング補題を用いて、文字列をuv^i wの形に分解する可能性を特定し、vを繰り返し可能な中間部(infix)とみなす。
- トレーランスリピートを抽出し、それをクラスタリングのための構造的シグネイチャー(特徴)として扱う。
- 圧縮に基づく類似度測定法(例:コード語長関数の使用)を用いて文字列を比較し、類似した分解を持つ文字列をグループ化する。
- 分解をuv^{≥2}wからuv^{+}w、さらにuv^{*}wへと階層的に一般化することで、異なる抽象度レベルでのクラスタリングを可能にする。
- 等価性検証を用いて、同じ言語を異なる表現で記述した場合(例:a(baa)+b と ab(aab)+)が正しく同一言語として識別されることを検証する。
- 共通するポンピング分解とトレーランスリピート構造に基づいて文字列をクラスタリングし、各文字列を言語ファミリーに割り当てる。
実験結果
リサーチクエスチョン
- RQ1正例のみで、負例が存在しない状況において、複数のペアワイズに不交差な正則言語を学習可能か?
- RQ2ポンピング補題に基づく分解とトレーランスリピートは、異なる言語に分類される文字列をクラスタリングするための信頼できる構造的特徴として機能するか?
- RQ3圧縮に基づく類似度測定は、同じ単純な正則言語に属する文字列を効果的にグループ化できるか?
- RQ4本手法は、産業用印刷ジョブデータから人間が解釈可能な言語パターン(例:(ab)+、a(bc)+a)を回復できるか?
- RQ5言語の単純さが、提案手法のクラスタリング手法の成功に与える影響は何か?
主な発見
- 本手法は23,000文字列を超えるデータセットから12の明確な印刷ジョブパターン((ab)+、(abc)+、a(bc)+aなど)を効果的に同定した。
- 同じトレーランスリピートまたはポンピング分解を持つ文字列は、一貫して同じ言語クラスタにグループ化された。これは構造的整合性の証左である。
- 圧縮に基づく類似度測定法は、共通する構造的パターンを効果的に捉え、ラベルなしで正確なクラスタリングを可能にした。
- uv^{≥2}wからuv^{*}wへの分解の階層的一般化により、繰り返しの度合いが異なる状況でも堅牢なクラスタリングが実現した。
- 本手法は産業現場での実用的妥当性を示し、現実世界の印刷ジョブシーケンスから解釈可能な言語パターンを回復できた。
- 等価性検証により、同じ言語を異なる表現で記述した場合(例:a(baa)+b と ab(aab)+)が正しく同一と識別された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。