Skip to main content
QUICK REVIEW

[論文レビュー] The Speech-Language Interface in the Spoken Language Translator

David M. Carter, Manny Rayner|ArXiv.org|Nov 23, 1994
Natural Language Processing Techniques参考文献 10被引用数 6
ひとこと要約

本稿では、音声認識器の出力を知的に処理することで翻訳精度を向上させる、話しかけ言語翻訳用の音声言語インターフェースを提示する。修理検出、文法特化、統合的音声・構文・意味スコアリングを用いて最適な意味構造を選択し、ATISドメインにおいて音声的にありそうな仮説が翻訳に適しているとは限らないことを示している。

ABSTRACT

The Spoken Language Translator is a prototype for practically useful systems capable of translating continuous spoken language within restricted domains. The prototype system translates air travel (ATIS) queries from spoken English to spoken Swedish and to French. It is constructed, with as few modifications as possible, from existing pieces of speech and language processing software. The speech recognizer and language understander are connected by a fairly conventional pipelined N-best interface. This paper focuses on the ways in which the language processor makes intelligent use of the sentence hypotheses delivered by the recognizer. These ways include (1) producing modified hypotheses to reflect the possible presence of repairs in the uttered word sequence; (2) fast parsing with a version of the grammar automatically specialized to the more frequent constructions in the training corpus; and (3) allowing syntactic and semantic factors to interact with acoustic ones in the choice of a meaning structure for translation, so that the acoustically preferred hypothesis is not always selected even if it is within linguistic coverage.

研究の動機と目的

  • 航空旅行(ATIS)などの制限付きドメインにおける話しかけ言語翻訳を向上させる、頑健な音声言語インターフェースの開発。
  • 音声認識エラーと断続的表現が翻訳品質に与える影響を受ける話しかけ言語理解の課題に対処すること。
  • 音声的信頼性スコアに依存するのではなく、言語的要因と音声的要因を統合して仮説選択を行うことで、翻訳精度を向上させること。
  • パイプライン型でモジュラーなシステムとして、既存の音声および言語処理コンポーネントを再利用することで、リアルタイム翻訳に適したシステムの実現可能性を示すこと。

提案手法

  • 音声認識器から言語理解モジュールに至るパイプライン型N-bestインターフェースを用い、複数の候補トランスクリプションを処理する。
  • 解析の前段階で、誤って始められた発話や自己修正などの断続的表現を特定・修正する修理検出メカニズムを適用する。
  • 学習コーパスにおける頻出構文に自動的に特化した文法を用いて、ATISクエリの一般的な処理を高速かつ効率的に行う。
  • 構文的・意味的・音声的スコアを統合したランク付け機構を用いて、音声的にあまり可能性がなくても意味的により妥当な意味構造を選択する。
  • 言語的妥当性が音声的好みを上回るハイブリッドスコアリングモデルを採用し、認識エラーによって翻訳品質が損なわれないよう保証する。
  • 音声および言語処理ソフトウェアの既存で検証済みのコンポーネントを再利用することで、開発の負荷を最小限に抑え、モularityを確保する。

実験結果

リサーチクエスチョン

  • RQ1話しかけ発話における断続的表現や認識エラーを、翻訳の前段階で効果的に検出し、修正することは可能か?
  • RQ2文法特化は、話しかけ言語翻訳システムにおける解析速度と正確性をどの程度向上させることができるか?
  • RQ3構文や意味といった言語的要因が、最良の翻訳仮説選択において音声的信頼性を上回ることができるか?
  • RQ4リアルタイム話しかけ翻訳に適した、モジュラーかつ再利用可能なアーキテクチャをどのように設計できるか?

主な発見

  • 本システムは、修理検出により断続的表現を特定・除去することで、仮説入力の言語的整合性を向上させ、話しかけ英語の断続的表現を効果的に処理している。
  • 学習コーパスの頻度に基づく文法特化により、一般的なATISクエリの処理速度が顕著に向上し、同時に高いカバー率を維持している。
  • 構文的および意味的要因と音声的スコアを統合することで、音声的にありそうなが言語的に不自然な仮説をシステムが除外できるようになった。
  • 最終的な翻訳品質が向上したのは、システムが常に上位の音声的仮説を選択するわけではないためであり、仮説選択において言語的妥当性が極めて重要な要因であることを示している。
  • モジュラー設計により、既存の音声および言語処理コンポーネントを再利用可能であり、最小限の再実装で機能的なプロトタイプを構築できるという実現可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。