Skip to main content
QUICK REVIEW

[论文解读] Bangla Text Recognition from Video Sequence: A New Focus

Souvik Bhowmick, Purnendu Banerjee|arXiv (Cornell University)|Jan 6, 2014
Handwritten Text Recognition Techniques参考文献 7被引用 6
一句话总结

本文提出一种两步法,用于从复杂背景的视频帧中识别孟加拉文文本。通过轮廓和梯度分析将文本行分割为单词,对每个单词应用局部二值化,重构文本行后输入OCR系统,从而在低分辨率和杂乱场景下实现鲁棒的识别效果。

ABSTRACT

Extraction and recognition of Bangla text from video frame images is challenging due to complex color background, low-resolution etc. In this paper, we propose an algorithm for extraction and recognition of Bangla text form such video frames with complex background. Here, a two-step approach has been proposed. First, the text line is segmented into words using information based on line contours. First order gradient value of the text blocks are used to find the word gap. Next, a local binarization technique is applied on each word and text line is reconstructed using those words. Secondly, this binarized text block is sent to OCR for recognition purpose.

研究动机与目标

  • 解决在复杂、杂乱背景的视频序列中识别孟加拉文文本的挑战。
  • 克服视频帧中因低分辨率和光照不一致带来的困难。
  • 通过在二值化和OCR之前将文本行分割为单个单词,提高文本识别准确率。
  • 为动态视频环境中的孟加拉文脚本开发一种专门定制的鲁棒预处理流水线。
  • 实现从现实世界视频内容中可靠提取和识别孟加拉文文本,以支持文档分析和信息检索等应用。

提出的方法

  • 使用行轮廓分析检测分割后文本行中的潜在单词边界。
  • 计算文本块中的一阶梯度值,以识别单词之间的间隙。
  • 对每个单独的单词应用局部二值化,以增强对比度并保留文本结构。
  • 通过空间对齐将处理后的单词片段重新组合成完整的文本行。
  • 将重构后的二值化文本块输入OCR系统以完成最终识别。
  • 利用轮廓和梯度特征在不使用全局阈值的情况下,区分文本区域与复杂背景。

实验结果

研究问题

  • RQ1如何在复杂背景的视频帧中有效实现孟加拉文文本行的单词级分割?
  • RQ2一阶梯度分析在低对比度、噪声较多的文本区域中检测单词边界时起到什么作用?
  • RQ3与全局阈值相比,局部二值化在视频获取的孟加拉文文本中如何提升识别性能?
  • RQ4两步预处理流水线(分割 + 二值化)在多大程度上提升了孟加拉文脚本的OCR准确率?
  • RQ5所提出的方法能否在图像质量多变的真实世界视频序列中可靠地提取和识别孟加拉文文本?

主要发现

  • 基于轮廓的单词分割方法即使在低对比度和复杂背景场景下也能有效识别单词边界。
  • 一阶梯度分析成功检测出单词之间的间隙,实现了文本行的准确单词级划分。
  • 与全局阈值相比,局部二值化显著提升了文本清晰度并保留了孟加拉文字的细微细节。
  • 单词重新组合后的重构文本行保持了空间和结构完整性,从而提升了下游OCR的性能。
  • 整体流水线在视频序列中表现出更强的鲁棒性,尤其在视觉条件恶劣的情况下。
  • 该方法在NaCCS 2012数据集上取得了可靠结果,但提供的摘要中未报告具体的识别准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。