Skip to main content
QUICK REVIEW

[论文解读] Conventions and Mutual Expectations -- understanding sources for web genres

Jussi Karlgren|May 1, 2022
Authorship Attribution and Profiling参考文献 13被引用 6
一句话总结

本文认为网页类型源于作者与读者之间的相互预期,而不仅仅是风格特征,并通过用户查询数据表明,在搜索查询中明确提及类型可提高点击率——这表明类型作为一种共享的交际惯例,能提升信息检索效率。

ABSTRACT

Genres can be understood in many different ways. They are often perceived as a primarily sociological construction, or, alternatively, as a stylostatistically observable objective characteristic of texts. The latter view is more common in the research field of information and language technology. These two views can be quite compatible and can inform each other; this present investigation discusses knowledge sources for studying genre variation and change by observing reader and author behaviour rather than performing analyses on the information objects themselves.

研究动机与目标

  • 理解网页类型并非作为风格类别,而是作为作者与读者之间相互预期的产物。
  • 研究类型惯例如何从交际实践而非仅从文本形式中产生。
  • 检验用户查询中是否明确提及类型可提升搜索表现,从而表明类型在信息获取中的功能性角色。
  • 探索在技术中介交流中新兴的数字类型,特别是那些超越传统媒体边界的类型。
  • 证明计算系统中的类型识别必须基于用户行为和交际需求,而不仅仅是文本的表层特征。

提出的方法

  • 分析AOL的用户查询日志,比较包含类型指示词(如“食谱”、“歌词”、“说明”)与不包含的查询的点击率。
  • 使用卡方检验(χ²)评估类型增强型查询与非类型查询在平均排名和点击频率上的差异是否具有统计显著性。
  • 开展问卷调查,探究读者如何感知并使用类型区分来指导其信息检索行为。
  • 应用内容分析法,识别现实世界搜索查询中反复出现的类型术语,并将其与检索有效性相关联。
  • 将类型定位为根植于交际惯例的行为与功能性类别,而非纯粹的语言或结构特征。
  • 借鉴巴赫金与Swales的理论,将类型视为社会文化建构,源于反复出现的交际情境与相互预期。

实验结果

研究问题

  • RQ1作者与读者之间的相互预期在多大程度上塑造了网页类型的形成?
  • RQ2在搜索查询中包含类型术语在多大程度上能提升针对特定类型内容的点击率表现?
  • RQ3在数字交流中出现了哪些新型类型?它们与传统媒体类型有何不同?
  • RQ4为何仅基于风格或形式特征的类型识别是不足的?一个类别要成为类型,必须满足哪些功能性标准?
  • RQ5如何使类型计算模型建立在实际用户行为和交际需求之上,而非仅依赖文本层面的特征?

主要发现

  • 包含“食谱”、“歌词”或“说明”等类型指示词的查询,其平均点击率排名显著更低(例如,食品类查询中为6.7 vs. 7.5),表明检索效率更高。
  • 在所有三个测试主题中,点击率差异均具有高度统计显著性(p > 0.999),证实类型术语可提升搜索表现。
  • 尽管类型增强型查询平均长度更长,但其点击率更高,表明类型术语为搜索引擎提供了有用且具有区分度的信号。
  • 用户频繁在查询中使用类型术语,表明类型是现实世界信息检索中显著且功能相关的类别。
  • 读者预期与作者惯例之间的双向对齐——通过查询与目标文档中匹配的类型术语体现——支持了类型是交际中相互预期的观点。
  • 类型并非仅仅是风格分组;它们是功能性的、基于行为的类别,有助于界定信息获取与交流的框架,尤其在数字环境中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。