Skip to main content
QUICK REVIEW

[论文解读] Temporal Analysis of Literary and Programming Prose

Brian Michalski, Mukkai S. Krishnamoorthy|arXiv (Cornell University)|Feb 9, 2012
Advanced Text Analysis Techniques参考文献 1被引用 5
一句话总结

本文提出了一种基于 Google Ngram Viewer 和提交日志的时序分析框架,用于比较文学作品与编程文本中的时序特征,发现两个领域中的时间引用均呈现非均匀模式——如文学中 'Sunday' 的使用比例异常偏高,软件项目中提交分布不均——表明存在行为与文化趋势。研究证明,尽管结构不同,但两个领域均可采用相似的统计方法进行分析。

ABSTRACT

Literary works reference a variety of globally shared themes including well-known people, events, and time periods. It is particularly interesting to locate patterns that are either invariant across time or exhibit a characteristic change across time, as they could imply something important about society that those works record. This paper suggests the use of Google n-gram viewer as a fast prototyping method for examining time-based properties over a rich sample of literary prose. Using this method, we find that some repeating periods of time, like Sunday, are referenced disproportionally, allowing us to pose questions such as why a day like Thursday is so unpopular. Furthermore, by treating software as a work of prose, we can apply a similar analysis to open-source software repositories and explore time-based relations in commit logs. Doing a simple statistical analysis on a few temporal keywords in the log records, we reinforce and weaken a few beliefs on how college students approach open source software. Finally, we help readers working on their own temporal analysis by comparing the fundamental differences between literary works and code repositories, and suggest blog or wiki as recently-emerging works.

研究动机与目标

  • 使用 Google Ngram Viewer 等广泛可用的数字工具,调查文学作品中的时序模式。
  • 比较文学作品与软件仓库中的时序行为,重点关注时间引用与提交活动。
  • 检验关于软件开发中人类行为的假设,例如工作是否集中在截止日期前。
  • 识别分析文学文本与软件仓库之间的方法论差异,特别是版本控制与时间元数据方面。
  • 探索博客与维基等新兴混合形式,作为文学与代码之间时序分析的中间形态。

提出的方法

  • 使用 Google Ngram Viewer 从 1800 至 2000 年间出版的数字化书籍中提取时间短语(如星期几)的相对频率。
  • 将软件提交日志视为时序性文本,提取时间戳以分析每日提交分布。
  • 应用基本统计分析(如 z 检验、置信区间)以评估观察到的偏离均匀分布是否具有统计显著性。
  • 通过聚类时间上接近的提交来计算会话时长,以估计连续编码会话的长度。
  • 使用均值与标准差总结每日提交比例,并与预期的 14.29% 均匀分布进行比较。
  • 在八个开源学生项目中评估项目特定的提交模式,以检测与截止日期相关的聚集现象。

实验结果

研究问题

  • RQ1在文学作品中,某些星期几(如 Sunday)是否被显著过度引用?这种现象可能由什么解释?
  • RQ2软件开发者是否表现出非均匀的提交行为,特别是在截止日期前出现聚集,如项目提交时间表所示?
  • RQ3在时间引用的频率与结构方面,文学作品中的时序模式与软件仓库中的时序模式有何异同?
  • RQ4开源项目中的提交日志在多大程度上反映了可预测的行为节律,如每周周期或会话时长?
  • RQ5由于博客与维基兼具文本与修订历史的混合特性,它们能否作为连接文学与软件时序分析的桥梁?

主要发现

  • 在文学作品中,'Sunday' 的引用频率显著高于其他星期几,表明其具有超越单纯时间记录的文化或叙事意义。
  • 在学生项目中,周五与周六的提交比例高于预期的 14.29% 均匀分布,表明可能存在与截止日期相关的开发模式。
  • 在八个项目的分析中,未发现任何星期几的偏离具有统计显著性,所有偏离的 95% 置信区间均包含零。
  • 各项目中平均编码会话时长约为 4.5 小时,部分项目表现出明显更长的会话(如 RPIDirectory 达 7 小时 29 分钟)。
  • 对多版文学作品的分析显示,1000 个抽样书籍中仅有 40 本有超过一次修订,限制了纵向文学分析的范围。
  • 软件仓库中的提交日志比文学文本提供更丰富的时序元数据,从而支持更细致且有意义的开发行为时序分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。