自動音声認識

term_id: automatic_speech_recognition

Category: application_paradigms

Definition

自動音声認識(ASR)、またはスピーチ・トゥ・テキストは、音声処理の一分野であり、人工知能を活用して音声信号を書き起こしテキストに変換します。現代のASRシステムは、音響モデリングと言語モデリングを組み合わせたディープラーニングアーキテクチャを採用しており、高い精度で雑音環境下での音声認識を実現しています。

Summary

ディープラーニングモデルを使用して、話し言葉をテキストに変換する技術。

Key Concepts

  • 音響モデリング
  • 言語モデリング
  • ディープラーニング
  • 文字起こし

Use Cases

  • 音声アシスタント(Siri、Alexaなど)
  • 動画のライブ字幕生成
  • 専門職向けのdictation(口述筆記)ソフトウェア