Whisper

term_id: whisper

Category: basic_concepts

Definition

Whisper là một mô hình nhận dạng giọng nói mục đích chung, được thiết kế để xử lý nhiều ngôn ngữ, phương ngữ và giọng điệu khác nhau. Nó được huấn luyện trên hàng trăm nghìn giờ dữ liệu âm thanh đa ngôn ngữ và giám sát đa nhiệm.

Summary

Một hệ thống nhận dạng giọng nói tự động (ASR) do OpenAI phát triển, được huấn luyện trên tập dữ liệu âm thanh đa dạng lớn.

Key Concepts

  • Nhận dạng giọng nói tự động (ASR)
  • Hỗ trợ đa ngôn ngữ
  • Khả năng chống nhiễu
  • Kiến trúc Transformer

Use Cases

  • Phụ đề và chú thích video
  • Chuyển văn bản từ cuộc họp hoặc bài giảng
  • Xử lý lệnh thoại

Code Example

1
2
3
4
import whisper
model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])