Automatisk talegenkendelse
term_id: automatic_speech_recognition
Category: application_paradigms
Definition
Automatisk talegenkendelse (ASR), også kendt som tale-til-tekst, er et underfelt inden for talebehandling, der udnytter kunstig intelligens til at transskribere lydsignaler til skriftlig tekst. Moderne ASR-systemer anvender neurale netværk til at analysere akustiske mønstre og sammenligne dem med sproglige modeller, hvilket gør det muligt at genkende tale med høj nøjagtighed under forskellige støjforhold og dialekter.
Summary
En teknologi, der omdanner talt sprog til tekst ved hjælp af dybe læringsmodeller.
Key Concepts
- Akustisk modellering
- Sproglig modellering
- Dyb læring
- Transskription
Use Cases
- Stemmeassistenter (Siri, Alexa)
- Live-undertekster til videoer
- Dikteringssoftware til professionelle