Nhận dạng giọng nói tự động
term_id: automatic_speech_recognition
Category: application_paradigms
Definition
Nhận dạng giọng nói tự động (ASR), còn được gọi là chuyển đổi giọng nói thành văn bản, là một lĩnh vực con của xử lý giọng nói, tận dụng trí tuệ nhân tạo để phiên âm các tín hiệu âm thanh thành văn bản viết. Các hệ thống ASR hiện đại sử dụng mạng nơ-ron sâu để phân tích đặc trưng âm thanh, dự đoán chuỗi từ và tạo ra văn bản chính xác với tốc độ cao, ngay cả trong môi trường có nhiễu.
Summary
Công nghệ chuyển đổi ngôn ngữ nói thành văn bản bằng cách sử dụng các mô hình học sâu.
Key Concepts
- Mô hình âm học
- Mô hình ngôn ngữ
- Học sâu
- Phiên âm
Use Cases
- Trợ lý giọng nói (Siri, Alexa)
- Phụ đề trực tiếp cho video
- Phần mềm gõ bằng giọng nói cho chuyên gia