Skip to main content
QUICK REVIEW

[論文レビュー] Smart Library: Identifying Books in a Library using Richly Supervised Deep Scene Text Reading

Xiao Yang, Dafang He|arXiv (Cornell University)|Nov 22, 2016
Music and Audio Processing参考文献 26被引用数 7
ひとこと要約

本稿では、本棚の画像から本を識別するために豊富な教師付きシーンテキスト読み取りを活用し、自動化された図書館在庫管理システムを提示する。ホフ変換に基づく背表紙分離と二重損失CRNNモデルを組み合わせたハイブリッドアプローチにより、大規模な本データベース上で91%のMRRおよびトップ1での90%のリCALLを達成し、本の検索における人的作業を顕著に削減する。

ABSTRACT

Physical library collections are valuable and long standing resources for knowledge and learning. However, managing books in a large bookshelf and finding books on it often leads to tedious manual work, especially for large book collections where books might be missing or misplaced. Recently, deep neural models, such as Convolutional Neural Networks (CNN) and Recurrent Neural Networks (RNN) have achieved great success for scene text detection and recognition. Motivated by these recent successes, we aim to investigate their viability in facilitating book management, a task that introduces further challenges including large amounts of cluttered scene text, distortion, and varied lighting conditions. In this paper, we present a library inventory building and retrieval system based on scene text reading methods. We specifically design our scene text recognition model using rich supervision to accelerate training and achieve state-of-the-art performance on several benchmark datasets. Our proposed system has the potential to greatly reduce the amount of human labor required in managing book inventories as well as the space needed to store book information.

研究の動機と目的

  • 大規模な物理的図書館コレクションの管理における人的作業を削減し、在庫構築と検索の自動化を図ること。
  • 複雑な背景、歪み、照明不良といった課題に直面する本の背表紙読み取りを、深層学習を用いて解決すること。
  • テキストベースの検索が、スケーラビリティと効率性において画像ベースの手法を上回ることを実証すること。
  • 本の表紙画像に依存せず、シーンテキスト情報のみを用いて本を識別するスケーラブルでエンドツーエンドのシステムを構築すること。
  • 豊富な教師付きデータを活用することで、シーンテキスト認識の性能を最適化するとともに、トレーニングを高速化すること。

提案手法

  • 複雑な本棚画像から個々の本の背表紙を分離するために、ホフ変換とシーンテキストの注目度を組み合わせた背表紙分離手法を開発した。
  • 分離された背表紙に対して、最先端のテキストロケーションモデルを用いて多方向のテキスト検出を実施した。
  • CNNとRNNを組み合わせた深層順序分類モデルをテキスト認識に用い、タイムステップごとの分類損失と改訂版Connectionist Temporal Classification (CTC) 損失を併用することで、トレーニングの収束を加速し、精度を向上させた。
  • テキスト認識の出力を、Solrベースの情報検索システム上でtf-idf重み付け検索のクエリキーワードとして使用し、データベース内の本の位置を特定した。
  • MRR、精度、リCALL、およびリCALL@kを用いて検索性能を評価し、正解タイトルを基準として上限性能を推定した。
  • ハイブリッドパイプラインは、回転推定、注目度生成、分離、語句ライン検出、および切り出しパッチの読み取りを経て、本棚画像を処理し、頑健な認識を実現した。

実験結果

リサーチクエスチョン

  • RQ1深層学習によるシーンテキスト読み取りは、大規模な物理的図書館における在庫管理の自動化に効果的に適用可能か?
  • RQ2本の識別において、テキストベースの検索と画像ベースの検索は、精度とスケーラビリティの観点でどのように比較されるか?
  • RQ3豊富な教師付きデータと二重損失トレーニングは、挑戦的な本の背表紙画像におけるテキスト認識性能をどの程度向上させるか?
  • RQ4正解タイトルをクエリとして使用した場合、テキストベースの本検索の上限性能はどの程度か?
  • RQ5ブラーと小文字サイズといった画像品質の問題が、実世界の本棚シナリオにおける検索精度にどのように影響を与えるか?

主な発見

  • 提案手法は、テキストベースのクエリのみを用いて平均逆順位(MRR)が0.91に達し、リCALLおよびFスコアにおいて従来手法を顕著に上回った。
  • トップ1でのリCALLが90%、トップ5内でのリCALLが96.4%に達し、9,000冊を超える大規模データベース上での検索効果性が明確に示された。
  • 従来のテキストのみの手法(2,300冊)よりもはるかに大きなデータベース(9,000冊以上)を扱っても、Fスコアが0.91(従来の0.72)を上回り、優れた性能を発揮した。
  • 類似したタイトルや低コントラスト・ぼやけたメタ情報といった、主な失敗要因に対しても、システムの性能は頑健であった。
  • タイムステップごとの損失と改訂版CTC損失を併用する二重損失トレーニング戦略により、ベンチマークデータセット上で収束が加速し、認識精度が向上した。
  • テキストベースの検索により、高解像度の本の表紙画像の保存や送信の必要性が削減され、リソースが限られたユーザーにとっても、システムのアクセス性とスケーラビリティが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。