Skip to main content
QUICK REVIEW

[论文解读] A Method to Support Difficult Re-finding Tasks

Gangli Liu, Ling Feng|arXiv (Cornell University)|Jan 27, 2016
Personal Information Management and User Behavior参考文献 14被引用 3
一句话总结

本文提出一种基于向导的机制,通过记录用户在文档交互过程中特有的属性(如阅读时间、页数、图片数量和打印频率)来支持困难的文档重新查找任务。通过使用问答界面引导用户回忆这些记忆线索,系统降低了认知负荷,并提高了重新查找的准确性,评估结果表明,利用一般性记忆线索可有效筛选大规模文档集合。

ABSTRACT

Re-finding electronic documents from a personal computer is a frequent demand to users. In a simple re-finding task, people can use many methods to retrieve a document, such as navigating directly to the document's folder, searching with a desktop search engine, or checking the Recent Files List. However, when encountering a difficult re-finding task, people usually cannot remember the attributes used by conventional re-finding methods, such as file path, file name, keywords etc., the re-finding would fail. We propose a new method to support difficult re-finding tasks. When a user is reading a document, we collect all kinds of possible memory pieces of the user about the document, such as number of pages, number of images, number of math formulas, cumulative reading time, reading frequency, printing experiences etc. If the user wants to re-find a document later, we use these collected attributes to filter out the target document. To alleviate the user's cognitive burden, we use a question and answer wizard interface and provide recommendations to the answers for the user, the recommendations are generated by analyzing the collected attributes of each document and the user's experiences about them.

研究动机与目标

  • 解决用户无法回忆标准元数据(如文件路径或关键词)时的困难文档重新查找挑战。
  • 通过分步问答向导界面减少用户在记忆回忆过程中的认知负担。
  • 收集并利用存储在长期记忆中的非传统属性(如阅读时长、图片数量和打印行为)以支持文档检索。
  • 开发一种精确的算法,基于输入活动模式估算用户在PDF文档上的阅读时间。
  • 评估基于属性的过滤在利用一般性记忆线索缩小大规模文档集合方面的有效性。

提出的方法

  • 在文档查看过程中记录所有可能的文档属性和用户交互体验(如阅读时间、页数、图片数量、打印事件)。
  • 使用问答向导界面引导用户回忆记忆线索,并基于存储的属性数据生成推荐。
  • 实现一种阅读时间估算算法,通过检测非活动时间间隔来判断阅读是否暂停或结束,从而最小化第一类和第二类错误。
  • 分析用户输入时间间隔模式,个性化调整非活动时间阈值以实现阅读时间检测,适应个体阅读习惯。
  • 使用多种一般性记忆线索(如“大小超过1MB”、“位于E盘”、“在周末打印”)进行基于属性的过滤,将候选文档集从10,000个减少至约15个。
  • 将所有数据本地存储于用户设备上,采用密码保护,并可选删除敏感记录以保护隐私。

实验结果

研究问题

  • RQ1如何有效利用超越标准元数据(如文件名、路径、关键词)的用户记忆线索来支持困难的文档重新查找任务?
  • RQ2在文档重新查找过程中,最小化认知负荷的最佳方式是什么?
  • RQ3如何基于输入活动模式准确估算PDF文档的阅读时间?
  • RQ4一般性、模糊的记忆线索(如“文件大小超过1MB”、“我在周末阅读过”)在多大程度上能减少候选文档集合?
  • RQ5记录用户文档交互数据的隐私影响是什么,以及如何加以缓解?

主要发现

  • 该系统通过使用16个一般性记忆线索,成功将10,000个候选文档减少至约15个,每个线索平均过滤掉约三分之一的无关文档。
  • 超过85%的用户输入间隔小于5分钟,表明大多数用户在阅读过程中表现出短暂的非活动期,有利于实现准确的阅读时间估算。
  • 通过输入模式分析可推导出用户特定的非活动时间阈值(如10–20分钟),从而提升个体用户的阅读时间检测准确性。
  • 向导界面通过将复杂的记忆回忆分解为可管理的独立问题并提供智能推荐,显著降低了认知负荷。
  • 该系统证明,非传统属性(如图片数量、打印频率和累计阅读时间)在文档重新查找中具有可行性与有效性。
  • 评估结果证实,即使是一般性、模糊的记忆线索,只要组合使用,也能被有效利用,从而在困难场景中实现成功的文档重新查找。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。