Automatisk talegenkendelse

term_id: automatic_speech_recognition

Category: application_paradigms

Definition

Automatisk talegenkendelse (ASR), også kendt som tale-til-tekst, er et underfelt inden for talebehandling, der udnytter kunstig intelligens til at transskribere lydsignaler til skriftlig tekst. Moderne ASR-systemer anvender neurale netværk til at analysere akustiske mønstre og sammenligne dem med sproglige modeller, hvilket gør det muligt at genkende tale med høj nøjagtighed under forskellige støjforhold og dialekter.

Summary

En teknologi, der omdanner talt sprog til tekst ved hjælp af dybe læringsmodeller.

Key Concepts

  • Akustisk modellering
  • Sproglig modellering
  • Dyb læring
  • Transskription

Use Cases

  • Stemmeassistenter (Siri, Alexa)
  • Live-undertekster til videoer
  • Dikteringssoftware til professionelle