Automatic Speech Recognition

term_id: automatic_speech_recognition

Category: application_paradigms

Definition

Automatic Speech Recognition (ASR), also known as speech-to-text, is a subfield of speech processing that leverages artificial intelligence to transcribe audio signals into written text. Modern ASR systems typically employ deep neural networks, such as recurrent neural networks or transformers, to map acoustic features to linguistic units. This technology enables voice interfaces, transcription services, and accessibility tools for hearing-impaired users.

Summary

A technology that converts spoken language into text using deep learning models.

Key Concepts

  • Acoustic Modeling
  • Language Modeling
  • Deep Learning
  • Transcription

Use Cases

  • Voice assistants (Siri, Alexa)
  • Live captioning for videos
  • Dictation software for professionals