Skip to main content
QUICK REVIEW

[論文レビュー] Annotations for HTML to VoiceXML Transcoding: Producing Voice WebPages with Usability in Mind

Zhiyan Shao, R. Capra|ArXiv.org|Nov 26, 2002
Speech and dialogue systems参考文献 13被引用数 4
ひとこと要約

本稿では、アクセシブルで使いやすい音声インターフェースを実現するため、HTMLコンテンツをVoiceXMLに変換するアノテーション駆動型アプローチを提案する。HTML内の繰り返し発生するデータ構造を特定することで、意味的意味を保持し、ターゲットとなるアノテーションを通じて使いやすさを向上させる変換パイプラインを設計した。その結果、完全なブラウジングを目的としないが、迅速な情報取得に最適化された、効率的でナビゲーション可能な音声ウェブページが実現された。

ABSTRACT

Web pages contain a large variety of information, but are largely designed for use by graphical web browsers. Mobile access to web-based information often requires presenting HTML web pages using channels that are limited in their graphical capabilities such as small-screens or audio-only interfaces. Content transcoding and annotations have been explored as methods for intelligently presenting HTML documents. Much of this work has focused on transcoding for small-screen devices such as are found on PDAs and cell phones. Here, we focus on the use of annotations and transcoding for presenting HTML content through a voice user interface instantiated in VoiceXML. This transcoded voice interface is designed with an assumption that it will not be used for extended web browsing by voice, but rather to quickly gain directed access to information on web pages. We have found repeated structures that are common in the presentation of data on web pages that are well suited for voice presentation and navigation. In this paper, we describe these structures and their use in an annotation system we have implemented that produces a VoiceXML interface to information originally embedded in HTML documents. We describe the transcoding process used to translate HTML into VoiceXML, including transcoding features we have designed to lead to highly usable VoiceXML code.

研究の動機と目的

  • 静的HTMLページをナビゲーション可能なVoiceXMLインターフェースに変換することで、音声アクセス可能なウェブコンテンツにおける使いやすさのギャップを解消すること。
  • 音声提示およびナビゲーションに適した、繰り返し発生する共通のデータ構造をHTMLから特定すること。
  • 使いやすさを最優先に据えた、HTMLからVoiceXMLへの変換を強化するアノテーションシステムの開発。
  • 完全なブラウジングではなく、音声による効率的で目的指向の情報取得を優先する変換機能の設計。
  • 結果として得られるVoiceXMLアプリケーションが、音声オンリー環境において意味的に正確で使いやすいことの保証。

提案手法

  • 著者たちは、繰り返し発生するHTML構造(たとえば、表、リスト、フォーム)を特定し、これらが音声インタラクションに適した機械可読データを含むことが頻繁に見られる。
  • これらの構造を、変換プロセスをガイドするメタデータでマークするための手動アノテーション方式を導入する。
  • 独自の変換パイプラインにより、アノテート済みHTMLを意味的に豊富なVoiceXMLに変換し、ナビゲーション構造とコンテンツ階層を保持する。
  • スピークアウトの制御(プロソディ、ラベル付け、ナビゲーションのキュー)にアノテーションを活用し、ユーザーの理解を向上させる。
  • 音声アクセスを、長時間のブラウジングではなく、迅速でタスク指向の情報取得手段として扱う。

実験結果

リサーチクエスチョン

  • RQ1HTML内の繰り返し発生する構造的パターンをどのように活用すれば、音声アクセス可能なウェブコンテンツの使いやすさが向上するか?
  • RQ2HTMLからVoiceXMLへの変換を効果的かつ意味的に明確に可能にするアノテーション戦略は何か?
  • RQ3音声インターフェースに変換する際、ナビゲーション構造とコンテンツ階層をどのように保持できるか?
  • RQ4音声オンリーのウェブアクセスにおいて、特に迅速な情報取得を目的とした場合に、使いやすさを高める設計原則は何か?
  • RQ5自動化された変換によって、ウェブコンテンツの完全な再実装なしに、使いやすいVoiceXMLを生成できる範囲はどの程度か?

主な発見

  • アノテーションシステムは、音声提示に最適な再利用可能なデータ構造を、HTML内で的確に特定・マークできた。
  • アノテーションを用いた変換により、論理的なコンテンツ階層を維持し、ナビゲーション性が向上したVoiceXMLアプリケーションが得られた。
  • システムは、完全なブラウジングではなく、迅速な情報取得を目的とした、効率的でタスク指向の情報アクセスを可能にした。
  • 使いやすさを重視した変換機能(たとえば、構造化されたメニュー、意味的ラベル付け)は、音声インターフェースにおけるユーザー理解を著しく向上させた。
  • ターゲットとなるアノテーションにより、コンテンツの再設計を要せず、既存のHTMLから使いやすいVoiceXMLを生成できることが示された。
  • 本手法は、静的ウェブコンテンツを最小限の手作業で、アクセシブルでインタラクティブな音声アプリケーションに効果的に変換できることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。