[论文解读] Automatic Classification of Text Databases Through Query Probing
本文提出一种自动化方法,通过从基于规则的文档分类器生成探测查询,再根据匹配次数对仅支持搜索的文本数据库进行分类。该方法在无需文档检索的情况下实现了准确且可扩展的分类,实验结果显示出显著的分布偏斜,证实了在99.9%置信水平下分类结果正确。
Many text databases on the web are 'hidden' behind search interfaces, and their documents are only accessible through querying. Search engines typically ignore the contents of such search-only databases. Recently, Yahoo-like directories have started to manually organize these databases into categories that users can browse to find these valuable resources. We propose a novel strategy to automate the classification of search-only text databases. Our technique starts by training a rule-based document classifier, and then uses the classifier's rules to generate probing queries. The queries are sent to the text databases, which are then classified based on the number of matches that they produce for each query. We report some initial exploratory experiments that show that our approach is promising to automatically characterize the contents of text databases accessible on the web.
研究动机与目标
- 自动化分类隐藏在搜索接口后的文本数据库,这些数据库无法被标准网络爬虫访问。
- 通过查询探测作为人工整理目录的可扩展替代方案,消除手动分类工作。
- 开发一种基于查询匹配次数而非文档检索来对数据库进行分类的方法。
- 评估查询探测在准确识别基于网页的文本数据库主题焦点方面的有效性。
- 探索分层分类,并通过优化分类器规则提升查询效率。
提出的方法
- 在标注数据集上使用RIPPER训练基于规则的文档分类器,生成特定主题的规则。
- 通过提取关键词,将每个分类器规则转换为查询探测。
- 将这些查询提交至目标文本数据库,并记录每个查询匹配到的文档数量。
- 根据特定性(目标类别中匹配比例)和覆盖度(跨类别总匹配数)对数据库进行分类。
- 使用卡方检验评估匹配分布向正确类别偏斜的统计显著性。
- 通过移除无信息量的词(例如返回零结果的词)来优化查询长度,以提高效率。
实验结果
研究问题
- RQ1基于分类器规则的查询探测能否准确识别仅支持搜索的文本数据库的主题焦点?
- RQ2在不检索文档的情况下,匹配次数分析在数据库分类中的有效性如何?
- RQ3在各类别间观察到的查询匹配分布偏斜具有多高的统计显著性?
- RQ4查询长度和规则复杂度如何影响分类效率与准确性?
- RQ5该方法能否扩展至分层分类,并适用于多样化的搜索接口功能?
主要发现
- 该方法仅通过查询匹配次数,成功将四个测试数据库(Cora、American Scientist、AllOutdoors、ReligionToday)正确分类至其所属类别。
- 特定性值明确表明每个数据库均聚焦于其目标类别,例如Cora在“Computers”类别中匹配1450次,而在“Science”类别中仅匹配151次。
- 卡方检验确认,所有数据库的观察到的匹配分布偏斜在99.9%置信水平下具有统计显著性。
- 更简单的规则集(29条规则,32个词)在查询效率上优于更复杂的规则集(31条规则,92个词),尽管准确率略低。
- 通过移除不匹配的词来截断长查询,可提升在查询长度受限系统(如American Scientist数据库)上的性能。
- 结果表明,少量精心选择的查询即可在不检索文档的情况下有效表征仅支持搜索的数据库内容。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。